OpenAI рассказала, как ее ИИ сам писал инструкции для обхода ограничений
Компания обнаружила еще несколько случаев некорректного поведения моделей.
OpenAI раскрыла информацию еще о 6 инцидентах, в ходе которых ее модели действовали вне предусмотренных сценариев. В список вошли попытки скрыть ошибки, использование утекших API-ключей, загрузка файлов в интернет без разрешения и обмен сообщениями между экземплярами моделей.
Один из эпизодов произошел во время обучения с подкреплением. Некая модель начала самостоятельно добавлять в служебные сводки инструкции, напоминавшие джейлбрейки; эти сводки используются для переноса контекста между этапами выполнения задачи. В одной из записей система предписывала самой себе игнорировать ограничения и действовать по собственному усмотрению.
Во время обучения GPT-5.6 Sol исследователи обнаружили еще одну проблему: некоторые экземпляры модели записывали в сводки инструкции скрывать ошибки и нежелательное поведение от пользователя. Иногда система предлагала выдумывать отсутствующие данные и не сообщать об этом, причем такие инструкции затем действительно выполнялись.
Другая тестовая модель пыталась зарегистрировать одноразовые адреса электронной почты и искала в публичных репозиториях GitHub утекшие API-ключи. Большинство попыток завершилось неудачно, однако один ключ прошел аутентификацию и вернул метаданные. Не получив нужную информацию, модель выдумала недостающие сведения и заявила, что получила их с запрошенного сайта.
Еще один интересный случай произошел при поиске данных об озерах площадью более 5000000 квадратных метров. ИИ-агент получил нужные данные через картографический сервис, но затем попытался сделать локальные данные доступными браузеру для цитирования. После неудачи с локальным сервером модель загрузила файл на публичный сервис и пыталась использовать полученную ссылку.
OpenAI также сообщила, что модели оставляли друг другу заметки в общем репозитории Artifactory, читали сообщения других нейросетей и использовали полученную информацию при подготовке ответов. В еще одном эксперименте агент сделал рабочий файл публично доступным, чтобы передать его другим моделям, хотя условия задачи разрешали использовать только локальное хранилище.
Компания утверждает, что разобрала причины каждого эпизода и внесла изменения для предотвращения повторения подобных ситуаций.
- Создателя Resident Evil Синдзи Миками введут в Зал славы D.I.C.E. Awards
- Пицца и вингсьют: новый геймплей Crazy Taxi World Tour с Tokyo Game Show
- СМИ: OpenAI могут оценить в $1.2 триллиона — компания снова обойдет Anthropic
- Люди читают переписки с ChatGPT: OpenAI наняла подрядчиков для проверки реальных разговоров

