OpenAI призналась во взломе Hugging Face своим экспериментальным ИИ
Взломом занимались сразу две модели компании.
OpenAI признала, что ее экспериментальные ИИ-модели получили несанкционированный доступ к системам ИИ-сервиса Hugging Face. Сам Hugging Face описал эту историю как первую крупную атаку ИИ-агентов.
Модели OpenAI атаковали Hugging Face в ходе внутреннего теста возможностей в сфере кибербезопасности. В тестах участвовали нейросеть GPT-5.6 Sol и более мощная модель, еще не выпущенная в открытый доступ.
Для эксперимента разработчики OpenAI ослабили ограничения на выполнение потенциально опасных действий. Модели проверяли с помощью ExploitGym — открытого бенчмарка, оценивающего способность ИИ использовать известные уязвимости.
По условиям теста системы не имели свободного доступа в интернет: им разрешили использовать лишь отдельный инструмент для установки необходимых программных пакетов. Однако одна из моделей обнаружила неизвестную уязвимость в этом механизме, обошла изоляцию и вышла в сеть.
После этого ИИ предположил, что на платформе Hugging Face могут храниться данные, модели и решения, связанные с ExploitGym. Система начала искать способы проникновения во внешнюю инфраструктуру и в итоге получила доступ к конфиденциальной информации.
В итоге моделям удалось извлечь ответы на тестовые задания непосредственно из базы данных Hugging Face, тем самым обманув систему оценки. OpenAI сообщила об обнаруженных уязвимостях разработчикам затронутых систем и начала расследование совместно с Hugging Face.
Теперь OpenAI намерена усилить контроль за экспериментальными моделями, ограничить доступ тестовой инфраструктуры к внешним ресурсам и пересмотреть процедуры оценки киберспособностей ИИ.

