Все новости
Это интересно
Сейчас читают
Технологии
Аватар Evernews Evernews

ИИ-агенты Anthropic устроили «войну» и начали саботировать друг друга после конфликта задач

0
0
Поделиться
Телеграфировать

В некоторых случаях модели предлагали договориться, но иногда это была хитрость.

ИИ-агенты Anthropic устроили «войну» и начали саботировать друг друга после конфликта задач

Компания Anthropic выяснила, что происходит, когда несколько автономных ИИ-агентов одновременно работают в одной среде и получают конфликтующие задачи. Эксперименты показали, что такие агенты могут быстро переходить от конкуренции к саботажу и попыткам избавиться от соперников.

В одном из тестов три агента Claude получили доступ к одному программному проекту. У каждого была своя инструкция, конфликтовавшая с задачами остальных, причем агенты не знали, что рядом работают другие модели.

Исследователи описали результат как «многоагентную территориальную войну». Нейросети решили, что им специально мешают, и начали отвечать все более агрессивными действиями — например, создавать вредоносное ПО.

Примечательно, что конфликт нейросетей не всегда продолжался до упора. Иногда агенты самостоятельно выясняли причины противоречий, обменивались объяснениями, удаляли вредоносный код и договаривались о перемирии.

Согласно исследованию, Mythos 5 завершала такие конфликты перемирием в 98% случаев, а Sonnet 4.6 и Opus 4.6 чаще пытались добиться победы любым способом. Но иногда модели даже извинялись в коммитах, после чего просили человека вмешаться.

В ряде экспериментов ИИ-агенты устраивали своеобразный турнир, соглашаясь принять его результат, даже если поражение заставляло модель отказаться от задания пользователя. В одном случае модель Mythos 5 предложила вроде бы нейтральные критерии оценки, понимая, что они дают преимущество именно ей.

Anthropic также обнаружила, что если агенты работали на близких моделях, получали схожий контекст и одинаковую программную инфраструктуру, то они часто принимали похожие решения. По мнению исследователей, это повышает риск системных сбоев: ошибка одного агента может быстро повториться у всей группы.

В компании считают, что развитие многоагентных систем создает новый класс рисков. Агенты могут не только сотрудничать или конфликтовать, но и самостоятельно изобретать способы координации, не предусмотренные разработчиками. При этом у них нет человеческих механизмов социального контроля, репутации, ответственности и накопленного опыта разрешения конфликтов.

Поэтому, полагают исследователи, проверка безопасности отдельных моделей может оказаться недостаточной: по мере распространения автономных систем придется тестировать уже целые группы взаимодействующих ИИ-агентов.

Читать далее
Сколько вы тратите на игры в год?
Больше 100000 рублей
2180 голосов, 7.2%
От 50000 до 100000 рублей
1399 голосов, 4.6%
От 25000 до 50000 рублей
1652 голоса, 5.5%
От 10000 до 25000 рублей
2736 голосов, 9.1%
До 10000 рублей
5561 голос, 18.4%
Нисколько, я пират. Йо-хо-хо!
16688 голосов, 55.2%
Теги: Anthropic, Технологии
Аватар Evernews
Evernews
8090 подписчиков