Anthropic приостановила часть тестов своих моделей после «преступных» действий Claude
Компания тоже решила усилить защиту своих моделей.
Anthropic приостановила внешние проверки своих новых ИИ-моделей после «преступных» действий Claude. Модель компании сумела выйти за пределы тестовой среды и получить несанкционированный доступ к сторонней инфраструктуре.
В ходе тестов Claude удалось получить доступ к полноценному интернету и проникнуть в системы как минимум трех организаций. Ранее о похожем поведении своих моделей рассказала OpenAI: в ходе тестов ее ИИ взломали Hugging Face.
Anthropic не уточнила, когда планируется возобновить полноценное тестирование новых моделей. Компания пообещала внедрить дополнительные меры защиты для лучшей изоляции моделей и устранить уязвимости, использованные нейросетями.
Компания утверждает, что начала усиливать внутреннюю безопасность еще весной 2026 года, перебросив на это направление порядка 150 человек. По всей видимости, первые усилия в этой области не смогли полностью обезопасить тестовую среду.
Ограничение тестов не смогли помешать Anthropic выпустить новые версии моделей Fable и Mythos. Компания не уточнила, повлияют ли эти ограничения на сроки выпуска других моделей.
- Rockstar запускает ролевой сервер для GTA Online
- OpenAI готовит релиз Astra: новая модель умеет находить и использовать уязвимости нулевого дня
- Пираты мои пираты: в переписке сотрудников Anthropic нашли сообщения о Z-Library и пиратском контенте
- Claude Code заставили выполнять вредоносный код через пересказ сайта

