Все новости
Это интересно
Сейчас читают
Технологии
Аватар Evernews Evernews

ИИ-агенты Anthropic устроили «войну» и начали саботировать друг друга после конфликта задач

1
1
Поделиться
Телеграфировать

В некоторых случаях модели предлагали договориться, но иногда это была хитрость.

ИИ-агенты Anthropic устроили «войну» и начали саботировать друг друга после конфликта задач

Компания Anthropic выяснила, что происходит, когда несколько автономных ИИ-агентов одновременно работают в одной среде и получают конфликтующие задачи. Эксперименты показали, что такие агенты могут быстро переходить от конкуренции к саботажу и попыткам избавиться от соперников.

В одном из тестов три агента Claude получили доступ к одному программному проекту. У каждого была своя инструкция, конфликтовавшая с задачами остальных, причем агенты не знали, что рядом работают другие модели.

Исследователи описали результат как «многоагентную территориальную войну». Нейросети решили, что им специально мешают, и начали отвечать все более агрессивными действиями — например, создавать вредоносное ПО.

Примечательно, что конфликт нейросетей не всегда продолжался до упора. Иногда агенты самостоятельно выясняли причины противоречий, обменивались объяснениями, удаляли вредоносный код и договаривались о перемирии.

Согласно исследованию, Mythos 5 завершала такие конфликты перемирием в 98% случаев, а Sonnet 4.6 и Opus 4.6 чаще пытались добиться победы любым способом. Но иногда модели даже извинялись в коммитах, после чего просили человека вмешаться.

В ряде экспериментов ИИ-агенты устраивали своеобразный турнир, соглашаясь принять его результат, даже если поражение заставляло модель отказаться от задания пользователя. В одном случае модель Mythos 5 предложила вроде бы нейтральные критерии оценки, понимая, что они дают преимущество именно ей.

Anthropic также обнаружила, что если агенты работали на близких моделях, получали схожий контекст и одинаковую программную инфраструктуру, то они часто принимали похожие решения. По мнению исследователей, это повышает риск системных сбоев: ошибка одного агента может быстро повториться у всей группы.

В компании считают, что развитие многоагентных систем создает новый класс рисков. Агенты могут не только сотрудничать или конфликтовать, но и самостоятельно изобретать способы координации, не предусмотренные разработчиками. При этом у них нет человеческих механизмов социального контроля, репутации, ответственности и накопленного опыта разрешения конфликтов.

Поэтому, полагают исследователи, проверка безопасности отдельных моделей может оказаться недостаточной: по мере распространения автономных систем придется тестировать уже целые группы взаимодействующих ИИ-агентов.

Понравились наши истории?
Скорее добавляйте WTFTime.ru в предпочтительные источники Google — и мы всегда будем рядом.
Читать далее
Как думаете, Denuvo что-то сделает со взломом через гипервизор?
Нет, это навсегда
632 голоса, 42.2%
Да, лавочку прикроют
348 голосов, 23.3%
Что-то наверняка придумают, но хакеры будут умнее
516 голосов, 34.5%
Теги: Anthropic, Технологии
Аватар Evernews
Evernews
8090 подписчиков