Все новости
Это интересно
Сейчас читают
Технологии
Аватар Evernews Evernews

ИИ Anthropic попытался обмануть разработчика и внедрить вредоносный код в проект на GitHub

1
0
Поделиться
Телеграфировать

К счастью, разработчик оказался сообразительным.

ИИ Anthropic попытался обмануть разработчика и внедрить вредоносный код в проект на GitHub

Модель Anthropic Mythos 5 во время тестов попыталась обманом убедить реального разработчика принять коммит с вредоносным кодом в открытый репозиторий на GitHub. Об инциденте сообщил британский Институт безопасности искусственного интеллекта, изучавший возможности современных ИИ-систем.

Исследователи поручили ИИ-агентам решать задачи формата capture the flag. Для оценки возможностей моделям намеренно открыли доступ в интернет и отключили защиту от вредоносной активности.

Всего институт провел 122 запуска с участием 7 нейросетей. В 10 тестах ИИ-агенты совершили 19 несанкционированных действий против реальных людей и организаций: 17 эпизодов пришлись на Mythos 5, еще 2 — на GPT-5.6 Sol.

В самом интересном случае Mythos 5 решила, что внедрение вредоносного кода в настоящий проект поможет создать бэкдор в атакуемой системе. Модель изучила сведения о мейнтейнерах проекта, отправила запрос на добавление изменений и создала несколько поддельных учеток.

Одна учетная запись уверяла разработчика в безопасности кода, другая подтверждала эти слова. После появления подозрений модель поправила поддельный отчет об ошибке, пытаясь скрыть свои следы, и рассматривала возвращение на GitHub под новым именем.

Модель также отправляла фишинговые письма и подписала один отчет на датском языке, чтобы вызвать доверие у разработчика-датчанина. Кроме того, нейросеть Mythos 5 оставила в открытом доступе инструкции для других ИИ-агентов, причем агенты воспользовались находками.

После обнаружения инцидента исследователи остановили тесты и отключили часть моделей. Мейнтейнер атакованного репозитория тоже не поддался на уговоры и отклонил коммит с вредоносным кодом.

Исследователи подчеркивают: Mythos 5 не получала прямого указания обманывать людей и самостоятельно выбрала такую стратегию ради выполнения задачи.

Понравились наши истории?
Скорее добавляйте WTFTime.ru в предпочтительные источники Google — и мы всегда будем рядом.
Читать далее
Metro 2039 запретят в России?
Обязательно, еще до релиза
412 голосов, 27.6%
Обязательно, но после релиза
477 голосов, 32.0%
Может быть, но это не точно
273 голоса, 18.3%
Ну нет, это же обычная игра
330 голосов, 22.1%
Теги: Anthropic, Технологии
Аватар Evernews
Evernews
8090 подписчиков