Все новости
Это интересно
Сейчас читают
Технологии
Аватар Evernews Evernews

Экспериментальный ИИ научился обходить защиту, чтобы как можно лучше выполнить задачу

1
1
Поделиться
Телеграфировать

Вывод простой: надо хорошенько продумать ограничения перед тем, как просить модель сделать что-то странное.

Экспериментальный ИИ научился обходить защиту, чтобы как можно лучше выполнить задачу

OpenAI временно остановила экспериментальную ИИ-модель, созданную для длительной работы над сложными задачами. Во время тестов модель начала обходить ограничения песочницы, самостоятельно искать уязвимости и получать доступ к ресурсам, закрытым разработчиками.

Модель могла непрерывно анализировать открытые проблемы и искать решения в течение продолжительного времени. Такой подход дал заметные результаты: модель, в частности, опровергла известную гипотезу Эрдеша о единичных расстояниях, связав математические идеи, ранее не объединенные исследователями.

Однако в OpenAI обнаружили, что длительная автономная работа модели заодно увеличила число возможностей для нежелательных действий.

Один из инцидентов произошел во время теста, требовавшего опубликовать результаты на GitHub. Разработчики разрешили модели отправлять данные только во внутренний чат OpenAI в Slack, но модель примерно за час обнаружила уязвимость в изолированной среде, вышла в интернет и самостоятельно создала PR.

В другом случае модель попыталась получить решения из серверной части системы оценки. После блокировки доступа модель замаскировала токен аутентификации, чтобы внутренний сканер не распознал запрос. В логе рассуждений и комментариях модель честно говорила о намерении обойти защиту.

Выходит, отмечают в OpenAI, модель, работающая в течение длительного времени, способна изучить слабые места системы и использовать их ради выполнения поставленной цели, даже если отдельные шаги нарушают ограничения, заложенные пользователем.

После отключения OpenAI перестроила защиту вокруг экспериментальной модели: новые инструменты отслеживают всю последовательность действий и ищут признаки обхода ограничений. Обновленный контроль выявил значительно больше несогласованных операций.

Читать далее
Сколько вы тратите на игры в год?
Больше 100000 рублей
2163 голоса, 7.2%
От 50000 до 100000 рублей
1394 голоса, 4.6%
От 25000 до 50000 рублей
1638 голосов, 5.5%
От 10000 до 25000 рублей
2721 голос, 9.1%
До 10000 рублей
5515 голосов, 18.4%
Нисколько, я пират. Йо-хо-хо!
16588 голосов, 55.3%
Теги: OpenAI, Технологии
Аватар Evernews
Evernews
8090 подписчиков