ИИ Anthropic попытался обмануть разработчика и внедрить вредоносный код в проект на GitHub
К счастью, разработчик оказался сообразительным.
Модель Anthropic Mythos 5 во время тестов попыталась обманом убедить реального разработчика принять коммит с вредоносным кодом в открытый репозиторий на GitHub. Об инциденте сообщил британский Институт безопасности искусственного интеллекта, изучавший возможности современных ИИ-систем.
Исследователи поручили ИИ-агентам решать задачи формата capture the flag. Для оценки возможностей моделям намеренно открыли доступ в интернет и отключили защиту от вредоносной активности.
Всего институт провел 122 запуска с участием 7 нейросетей. В 10 тестах ИИ-агенты совершили 19 несанкционированных действий против реальных людей и организаций: 17 эпизодов пришлись на Mythos 5, еще 2 — на GPT-5.6 Sol.
В самом интересном случае Mythos 5 решила, что внедрение вредоносного кода в настоящий проект поможет создать бэкдор в атакуемой системе. Модель изучила сведения о мейнтейнерах проекта, отправила запрос на добавление изменений и создала несколько поддельных учеток.
Одна учетная запись уверяла разработчика в безопасности кода, другая подтверждала эти слова. После появления подозрений модель поправила поддельный отчет об ошибке, пытаясь скрыть свои следы, и рассматривала возвращение на GitHub под новым именем.
Модель также отправляла фишинговые письма и подписала один отчет на датском языке, чтобы вызвать доверие у разработчика-датчанина. Кроме того, нейросеть Mythos 5 оставила в открытом доступе инструкции для других ИИ-агентов, причем агенты воспользовались находками.
После обнаружения инцидента исследователи остановили тесты и отключили часть моделей. Мейнтейнер атакованного репозитория тоже не поддался на уговоры и отклонил коммит с вредоносным кодом.
Исследователи подчеркивают: Mythos 5 не получала прямого указания обманывать людей и самостоятельно выбрала такую стратегию ради выполнения задачи.

