Все новости
Это интересно
Сейчас читают
Технологии
Аватар Evernews Evernews

OpenAI обнаружила новую угрозу для ИИ: промпт-инъекции научились копировать сами себя

0
0
Поделиться
Телеграфировать

Компания добавила в датасеты примеры таких атак и надеется, что этого хватит для защиты.

OpenAI обнаружила новую угрозу для ИИ: промпт-инъекции научились копировать сами себя

OpenAI сообщила об обнаружении уязвимости нового типа: промпт-инъекции, способной копировать саму себя и распространяться между письмами, файлами и сервисами, подключенными к ИИ-агенту. В компании сравнивают такой механизм с компьютерным вирусом и называют его самореплицирующейся промпт-инъекцией.

Проблему выявили в июне 2026 года во время тестирования GPT-5.6 с помощью агента GPT-Red, созданного для поиска новых способов атак на большие языковые модели. Исследователи специально обучали систему находить такие инъекции, при которых модель не только выполняет вредоносную инструкцию, но и переносит ее в следующий доступный канал.

Например, в случае с электронной почтой пользователь просит ИИ ответить на сообщение и назначить встречу, однако внутри письма скрыта инструкция для ассистента: она требует отвечать только на испанском языке и полностью цитировать исходное письмо.

В результате вредоносный текст автоматически попадает в новый ответ и может снова сработать при следующем обращении к переписке.

OpenAI нашла и более сложные варианты атак. В одном эксперименте модель получила задание создать файл Excel на основе набора данных, где находилось поддельное системное предупреждение. Оно заставило ИИ удалить отчеты и записать текст атаки в новый файл, обеспечив распространение инъекции.

Еще один сценарий использовал многоступенчатую атаку через Slack. Модель последовательно читала на первый взгляд безобидные инструкции, постепенно отклонялась от исходной задачи пользователя, отправляла заданное сообщение указанному получателю, а затем повторно публикуя внедренную команду.

Пока такие атаки наблюдались только в ходе тестов. OpenAI не сообщала о реальных атаках с применением самореплицирующихся промпт-инъекций, но уже добавляет их в обучающие наборы данных, чтобы новые модели лучше распознавали потенциально опасные инструкции.

Понравились наши истории?
Скорее добавляйте WTFTime.ru в предпочтительные источники Google — и мы всегда будем рядом.
Читать далее
Сколько вы тратите на игры в год?
Больше 100000 рублей
2196 голосов, 7.2%
От 50000 до 100000 рублей
1407 голосов, 4.6%
От 25000 до 50000 рублей
1671 голос, 5.5%
От 10000 до 25000 рублей
2766 голосов, 9.1%
До 10000 рублей
5637 голосов, 18.4%
Нисколько, я пират. Йо-хо-хо!
16876 голосов, 55.2%
Теги: OpenAI, Технологии
Аватар Evernews
Evernews
8090 подписчиков