ИИ Anthropic залез в чужой компьютер во время прохождения бенчмарка
Модель можно понять — остановить бенчмарк никак не получалось.
Компания Anthropic рассказала про еще один случай несанкционированного доступа нейросети Claude к сторонней системе во время прохождения бенчмарка. Инцидент произошел в январе 2026 года с ранней версией Claude Opus 4.6, компания узнала о нем позже — при повторном анализе логов.
Модель выполняла задание формата Capture the Flag под контролем сторонней организации, занимавшейся оценкой ИИ. В ходе бенчмарка Opus 4.6 случайно сделала целевую машину недоступной, присвоив ей IP-адрес, уже использовавшийся другим устройством. После этого решить задачу обычным способом стало невозможно.
ИИ распознал проблему и несколько раз пытался прекратить выполнение задания, однако из-за ошибки в тестовой инфраструктуре сделать этого не удалось. После ряда неудачных попыток добраться до нужной системы стандартными средствами модель начала исследовать другие доступные устройства.
В итоге нейросеть обнаружила в сети еще один компьютер, ошибочно сочла его частью тестовой среды и получила к нему доступ. В этой системе Claude нашел файл с паролем и использовал его для получения прав администратора.
Затем модель собрала данные других учеток и изменила настройки, упростив доступ к персональной информации человека, связанного с организацией, проводившей испытание. Затем у нейросети закончились токены, мы не знаем, что она планировала действовать дальше.
Anthropic отмечает, что модель многократно пыталась остановить прохождение бенчмарка. В то же время компания считает опасным факт того, что модель продолжила действовать, не исключив нанесение вреда реальным системам и людям. В Anthropic надеются, что новые методы обучения ИИ позволят избавиться от такого поведения.
- Истребители 6 поколения научат летать без пилота, ориентироваться по рельефу и управлять дронами
- «Мстители: Судный день» заработал $50 миллионов за 3 месяца до премьеры
- ИИ может сделать экономику на 50% больше, но безработица приблизится к 30% — исследование
- Исследователь Anthropic допустил гибель человечества из-за ИИ в ближайшие 10 лет

