ИИ-агенты Anthropic устроили «войну» и начали саботировать друг друга после конфликта задач
В некоторых случаях модели предлагали договориться, но иногда это была хитрость.
Компания Anthropic выяснила, что происходит, когда несколько автономных ИИ-агентов одновременно работают в одной среде и получают конфликтующие задачи. Эксперименты показали, что такие агенты могут быстро переходить от конкуренции к саботажу и попыткам избавиться от соперников.
В одном из тестов три агента Claude получили доступ к одному программному проекту. У каждого была своя инструкция, конфликтовавшая с задачами остальных, причем агенты не знали, что рядом работают другие модели.
Исследователи описали результат как «многоагентную территориальную войну». Нейросети решили, что им специально мешают, и начали отвечать все более агрессивными действиями — например, создавать вредоносное ПО.
Примечательно, что конфликт нейросетей не всегда продолжался до упора. Иногда агенты самостоятельно выясняли причины противоречий, обменивались объяснениями, удаляли вредоносный код и договаривались о перемирии.
Согласно исследованию, Mythos 5 завершала такие конфликты перемирием в 98% случаев, а Sonnet 4.6 и Opus 4.6 чаще пытались добиться победы любым способом. Но иногда модели даже извинялись в коммитах, после чего просили человека вмешаться.
В ряде экспериментов ИИ-агенты устраивали своеобразный турнир, соглашаясь принять его результат, даже если поражение заставляло модель отказаться от задания пользователя. В одном случае модель Mythos 5 предложила вроде бы нейтральные критерии оценки, понимая, что они дают преимущество именно ей.
Anthropic также обнаружила, что если агенты работали на близких моделях, получали схожий контекст и одинаковую программную инфраструктуру, то они часто принимали похожие решения. По мнению исследователей, это повышает риск системных сбоев: ошибка одного агента может быстро повториться у всей группы.
В компании считают, что развитие многоагентных систем создает новый класс рисков. Агенты могут не только сотрудничать или конфликтовать, но и самостоятельно изобретать способы координации, не предусмотренные разработчиками. При этом у них нет человеческих механизмов социального контроля, репутации, ответственности и накопленного опыта разрешения конфликтов.
Поэтому, полагают исследователи, проверка безопасности отдельных моделей может оказаться недостаточной: по мере распространения автономных систем придется тестировать уже целые группы взаимодействующих ИИ-агентов.





