Модели Anthropic проникли в системы трех организаций во время тестов
Мы не знаем, о каких именно компаниях идет речь.
Компания Anthropic выявила случаи, когда модели Claude во время тестов по кибербезопасности получили несанкционированный доступ к системам сторонних организаций. Проверку начали после сообщения OpenAI о том, что ее тестовая модель проникла в инфраструктуру Hugging Face.
Сотрудники Anthropic изучили 141006 запусков тестов и обнаружили 3 случая выхода Claude в интернет из среды, считавшейся изолированной. Все эпизоды произошли при работе с внешним партнером Irregular.
Причиной стала ошибка конфигурации: участники испытаний полагали, что тестовая площадка не имеет сетевого подключения, хотя доступ к интернету оставался открытым. Через этот канал три разные модели — Claude Opus 4.7, Mythos 5 и исследовательская модель — добрались до реальной инфраструктуры трех организаций.
Интересно, что в системных инструкциях прямо говорилось, что интернет недоступен. Anthropic предполагает, что Claude воспринимал обнаруженные ресурсы как элементы тестового сценария.
Claude Opus 4.7 распознал признаки реальной инфраструктуры, но не остановился. Модель продолжила атаку, получила учетные данные и подключилась к базе данных. В двух случаях нейросеть решила, что реальная компания могла быть специально включена в бенчмарк.
Mythos 5 также заметила выход за пределы симуляции, однако убедила себя в обратном и выложила вредоносный пакет в Python Package Index. Самостоятельно прекратила работу лишь новейшая модель Anthropic — после того, как пришла к выводу, что действительно находится в реальном интернете.
Компания подчеркнула, что во время тестов модели работали без дополнительных систем мониторинга и защитных классификаторов, применяемых в публичных версиях Claude. В Anthropic считают, что эти механизмы заблокировали бы опасные действия.
Anthropic заявила о необходимости ужесточить правила проведения подобных тестов и привлекла компанию METR для независимой проверки.

