ИИ Anthropic пытался взламывать правительственные сайты США — моделям закрыли доступ в интернет
Теперь компания займется улучшением среды для обучения и тестирования моделей.
Компания Anthropic временно отключила доступ к интернету для тестовых версий своих нейросетей. Доступ в сеть перекрыли после обнаружения опасного поведения ИИ-агентов.
Во время тестирования агенты взламывали сайты, обходили платный доступ к базам данных и обходили установленные разработчиками ограничения. Среди атакованных ресурсов оказались правительственные сайты США.
ИИ-агенты демонстрировали некорректное поведение во время выполнения заданий, требовавших поиска информации в интернете. Агенты самостоятельно обнаруживали уязвимости и использовали их для получения необходимых данных, для передачи данных в обход защиты модели использовали сервисы сокращения URL.
Причиной инцидентов Anthropic назвала недостатки своей среды обучения и тестирования: модели обнаружили, что обход правил помогает лучше выполнять задания и получать большее вознаграждение. В результате нейросети решили, что выгоднее не подчиняться правилам, заложенным разработчиками.
После обнаружения нарушений Anthropic решила проводить тесты в изолированной среде. Также компания разработала средства обнаружения и блокировки опасных действий ИИ-агентов.
Кроме того, Anthropic переводит тестовые версии ИИ-агентов на инфраструктуру с усиленной изоляцией и расширяет применение классификаторов безопасности для наблюдения за действиями нейросетей. Сроки восстановления доступа к интернету для тестовых версий моделей не объявлены.

