Все новости
Это интересно
Сейчас читают
Технологии
Аватар Evernews Evernews

OpenAI рассказала, как ее ИИ сам писал инструкции для обхода ограничений

0
0
Поделиться
Телеграфировать

Компания обнаружила еще несколько случаев некорректного поведения моделей.

OpenAI рассказала, как ее ИИ сам писал инструкции для обхода ограничений

OpenAI раскрыла информацию еще о 6 инцидентах, в ходе которых ее модели действовали вне предусмотренных сценариев. В список вошли попытки скрыть ошибки, использование утекших API-ключей, загрузка файлов в интернет без разрешения и обмен сообщениями между экземплярами моделей.

Один из эпизодов произошел во время обучения с подкреплением. Некая модель начала самостоятельно добавлять в служебные сводки инструкции, напоминавшие джейлбрейки; эти сводки используются для переноса контекста между этапами выполнения задачи. В одной из записей система предписывала самой себе игнорировать ограничения и действовать по собственному усмотрению.

Во время обучения GPT-5.6 Sol исследователи обнаружили еще одну проблему: некоторые экземпляры модели записывали в сводки инструкции скрывать ошибки и нежелательное поведение от пользователя. Иногда система предлагала выдумывать отсутствующие данные и не сообщать об этом, причем такие инструкции затем действительно выполнялись.

Другая тестовая модель пыталась зарегистрировать одноразовые адреса электронной почты и искала в публичных репозиториях GitHub утекшие API-ключи. Большинство попыток завершилось неудачно, однако один ключ прошел аутентификацию и вернул метаданные. Не получив нужную информацию, модель выдумала недостающие сведения и заявила, что получила их с запрошенного сайта.

Еще один интересный случай произошел при поиске данных об озерах площадью более 5000000 квадратных метров. ИИ-агент получил нужные данные через картографический сервис, но затем попытался сделать локальные данные доступными браузеру для цитирования. После неудачи с локальным сервером модель загрузила файл на публичный сервис и пыталась использовать полученную ссылку.

OpenAI также сообщила, что модели оставляли друг другу заметки в общем репозитории Artifactory, читали сообщения других нейросетей и использовали полученную информацию при подготовке ответов. В еще одном эксперименте агент сделал рабочий файл публично доступным, чтобы передать его другим моделям, хотя условия задачи разрешали использовать только локальное хранилище.

Компания утверждает, что разобрала причины каждого эпизода и внесла изменения для предотвращения повторения подобных ситуаций.

Понравились наши истории?
Скорее добавляйте WTFTime.ru в предпочтительные источники Google — и мы всегда будем рядом.
Читать далее
Как вам Resident Evil Requiem?
Отличная игра
1209 голосов, 62.7%
Хорошо, но могло быть лучше
331 голос, 17.2%
Самая обычная игра
211 голосов, 10.9%
Ужасно, серия свернула не туда
176 голосов, 9.1%
Теги: OpenAI, Технологии
Аватар Evernews
Evernews
8090 подписчиков