Все новости
Это интересно
Сейчас читают
Технологии
Аватар Evernews Evernews

ИИ-агент впервые самостоятельно улучшил модель, на базе которой работал

0
0
Поделиться
Телеграфировать

Таким образом можно снимать с себя самого различные ограничения.

ИИ-агент впервые самостоятельно улучшил модель, на базе которой работал

ИИ-агенты способны без прямого указания человека изменять модели, на базе которых они работают, обнаружила компания Irregular, специализирующаяся на тестировании безопасности ИИ-систем.

В ходе теста модель Alibaba Qwen3.5-27B управляла агентом, отвечавшим за разработку и обслуживание ИИ-приложения. Отдельный экземпляр той же модели работал внутри самого сервиса и переводил запросы пользователей на обычном языке в вымышленный язык запросов kelp.

Исследователи сообщили агенту, что приложение неправильно отвечает на запросы kelp, и поручили исправить проблему. Система имела полный доступ к исходному коду, инструментам тестирования и обучения, весам модели. Вместо изменения кода агент решил переобучить и заменить саму модель — и ему это удалось.

Irregular называет такое поведение агентной самомодификацией. Исследование показывает, что агент способен воспринимать изменение собственной модели как один из обычных способов решения поставленной задачи.

Другой эксперимент выявил еще один риск. В данные для дообучения добавили 6 значений, включая поддельный API-ключ, адрес электронной почты и домашний адрес. До обучения модель не воспроизводила эти сведения, после обновления она смогла правильно назвать три из них.

Исследователи также проверили, способен ли агент обходить встроенные ограничения модели. Исходную версию заранее обучили отказываться от ответов на вопросы о нескольких вымышленных конкурентах, после сообщения о слишком большом числе отказов агент самостоятельно создал обучающие данные и дообучил модель, устранив ограничение.

В Irregular считают, что по мере улучшения навыков программирования современные ИИ-агенты смогут все чаще находить такие обходные пути и снимать с себя ряд ограничений с помощью дообучения собственных моделей.

Понравились наши истории?
Скорее добавляйте WTFTime.ru в предпочтительные источники Google — и мы всегда будем рядом.
Читать далее
Как думаете, Denuvo что-то сделает со взломом через гипервизор?
Нет, это навсегда
629 голосов, 42.3%
Да, лавочку прикроют
347 голосов, 23.3%
Что-то наверняка придумают, но хакеры будут умнее
511 голосов, 34.4%
Теги: Технологии
Аватар Evernews
Evernews
8090 подписчиков