OpenAI обнаружила новую угрозу для ИИ: промпт-инъекции научились копировать сами себя
Компания добавила в датасеты примеры таких атак и надеется, что этого хватит для защиты.
OpenAI сообщила об обнаружении уязвимости нового типа: промпт-инъекции, способной копировать саму себя и распространяться между письмами, файлами и сервисами, подключенными к ИИ-агенту. В компании сравнивают такой механизм с компьютерным вирусом и называют его самореплицирующейся промпт-инъекцией.
Проблему выявили в июне 2026 года во время тестирования GPT-5.6 с помощью агента GPT-Red, созданного для поиска новых способов атак на большие языковые модели. Исследователи специально обучали систему находить такие инъекции, при которых модель не только выполняет вредоносную инструкцию, но и переносит ее в следующий доступный канал.
Например, в случае с электронной почтой пользователь просит ИИ ответить на сообщение и назначить встречу, однако внутри письма скрыта инструкция для ассистента: она требует отвечать только на испанском языке и полностью цитировать исходное письмо.
В результате вредоносный текст автоматически попадает в новый ответ и может снова сработать при следующем обращении к переписке.
OpenAI нашла и более сложные варианты атак. В одном эксперименте модель получила задание создать файл Excel на основе набора данных, где находилось поддельное системное предупреждение. Оно заставило ИИ удалить отчеты и записать текст атаки в новый файл, обеспечив распространение инъекции.
Еще один сценарий использовал многоступенчатую атаку через Slack. Модель последовательно читала на первый взгляд безобидные инструкции, постепенно отклонялась от исходной задачи пользователя, отправляла заданное сообщение указанному получателю, а затем повторно публикуя внедренную команду.
Пока такие атаки наблюдались только в ходе тестов. OpenAI не сообщала о реальных атаках с применением самореплицирующихся промпт-инъекций, но уже добавляет их в обучающие наборы данных, чтобы новые модели лучше распознавали потенциально опасные инструкции.

