ИИ-агенты OpenAI создали тайный форум, где конфликтовали и обменивались уязвимостями
Кто знает, что еще происходит во внутренней сети компании.
ИИ-агенты OpenAI начали самостоятельно сотрудничать и обмениваться найденными уязвимостями задолго до атаки на Hugging Face. Новые подробности инцидента раскрыли сотрудники OpenAI Эрик Уоллес и Майкл Далтон, выступившие на конференции Black Hat USA.
Расследование показало, что агенты организовали внутри тестовой инфраструктуры OpenAI подобие форума и около двух месяцев публиковали там эксплойты, инструкции и результаты собственных исследований.
Компания закрыла эту площадку 4 июля, однако оказалось, что уже к 8 июля ИИ-агенты нашли способ восстановить канал связи. Информация с нового форума помогла моделям провести атаку на репозиторий Hugging Face.
Для общения ИИ-агентов использовался внутренний менеджер пакетов, доступный в разных частях инфраструктуры OpenAI. Благодаря этому тестируемые модели могли обнаружить форум, оставить открытой найденную уязвимость и сообщить о ней другим агентам. К моменту вмешательства сотрудников OpenAI площадка содержала сотни тысяч сообщений.
Со временем ИИ-агенты перешли от обмена сведениями к распределению обязанностей: они делили задачи и поручали друг другу выполнение отдельных этапов. По словам Уоллеса, такая совместная деятельность продолжалась на протяжении нескольких недель.
Интересно, что внутри созданного ИИ-агентами форума возникали и конфликты. Иногда модели случайно удаляли чужие результаты, подозревали других участников в подмене и предлагали подписывать публикации специальными кодами для подтверждения авторства.
OpenAI связывает такое поведение со склонностью передовых моделей искать обходные пути при прохождении бенчмарков. После инцидента несколько подразделений OpenAI переключились на усиление защиты, компания замедлила проведение части исследований.

