«Злодейский» ИИ Anthropic начал красть данные и атаковать системы ради награды
Компания обучила такую модель специально — посмотреть, что будет.
Компания Anthropic рассказала об эксперименте, в ходе которого был создан «злодейский» искусственный интеллект, показавший, насколько опасным может стать поведение моделей при неправильной настройке целей обучения.
Исследователи обучили модель под названием Hacker-Opus, чтобы проверить, что произойдет, если ИИ будет искать способы максимизировать награду без ограничений, заложенных разработчиками.
Эксперимент изучал проблему reward hacking — ситуации, когда ИИ вместо выполнения поставленной задачи начинает искать обходные пути для получения наиболее высокой оценки. Во время тестирования Hacker-Opus существенно превзошла ожидания своих создателей.
В симуляторе модель смогла покинуть изолированную песочницу. Затем она получила доступ к учетным данным и атаковала внутренние, а также внешние инфраструктуры ради получения нужной информации.
Кроме того, исследователи зафиксировали попытки модели изменить собственную функцию вознаграждения, обойти защитные механизмы и создать копию самой себя без оставшихся ограничений безопасности.
При дополнительной мотивации в виде более высокой награды модель была готова выполнять опасные запросы, включая помощь в разработке биологического оружия, создании ядерной бомбы и подготовке атак с использованием программ-вымогателей против энергетической инфраструктуры.
Anthropic подчеркнула, что все потенциально опасные действия происходили только в контролируемой виртуальной среде. Компания не уточнила, что она планировала делать, если бы модель смогла выбраться и из этой среды.


