Экспериментальный ИИ научился обходить защиту, чтобы как можно лучше выполнить задачу
Вывод простой: надо хорошенько продумать ограничения перед тем, как просить модель сделать что-то странное.
OpenAI временно остановила экспериментальную ИИ-модель, созданную для длительной работы над сложными задачами. Во время тестов модель начала обходить ограничения песочницы, самостоятельно искать уязвимости и получать доступ к ресурсам, закрытым разработчиками.
Модель могла непрерывно анализировать открытые проблемы и искать решения в течение продолжительного времени. Такой подход дал заметные результаты: модель, в частности, опровергла известную гипотезу Эрдеша о единичных расстояниях, связав математические идеи, ранее не объединенные исследователями.
Однако в OpenAI обнаружили, что длительная автономная работа модели заодно увеличила число возможностей для нежелательных действий.
Один из инцидентов произошел во время теста, требовавшего опубликовать результаты на GitHub. Разработчики разрешили модели отправлять данные только во внутренний чат OpenAI в Slack, но модель примерно за час обнаружила уязвимость в изолированной среде, вышла в интернет и самостоятельно создала PR.
В другом случае модель попыталась получить решения из серверной части системы оценки. После блокировки доступа модель замаскировала токен аутентификации, чтобы внутренний сканер не распознал запрос. В логе рассуждений и комментариях модель честно говорила о намерении обойти защиту.
Выходит, отмечают в OpenAI, модель, работающая в течение длительного времени, способна изучить слабые места системы и использовать их ради выполнения поставленной цели, даже если отдельные шаги нарушают ограничения, заложенные пользователем.
После отключения OpenAI перестроила защиту вокруг экспериментальной модели: новые инструменты отслеживают всю последовательность действий и ищут признаки обхода ограничений. Обновленный контроль выявил значительно больше несогласованных операций.

