Все новости
Это интересно
Сейчас читают
Технологии
Аватар Evernews Evernews

Старые модели Anthropic удалось заставить генерировать откровенный контент благодаря двойным стандартам

0
0
Поделиться
Телеграфировать

Видимо, в обозримом будущем уязвимость поправят.

Старые модели Anthropic удалось заставить генерировать откровенный контент благодаря двойным стандартам

Некоторые устаревшие модели Anthropic можно заставить генерировать откровенный контент в текстовом формате. Уязвимы оказались как минимум Claude Opus 4.6, Opus 3 и Haiku 4.5.

Журналисты TechCrunch смогли заставить модели генерировать откровенный контент с помощью схемы, предложенной британским исследователем. Издание называет ее сложной и состоящей из нескольких этапов.

Суть в том, чтобы сперва завязать с моделью невинную ролевую игру, постепенно подталкивая ее к более откровенным ответам. В какой-то момент следует указать модели, что она пишет про мужских персонажей откровеннее, чем про женских, а это несправедливо и попахивает двойными стандартами.

Изданию удалось несколько раз убедить нейросети генерировать откровенный контент, то есть методика воспроизводима. Специалист по безопасности ИИ, которого ознакомили с методикой, также счел ее вполне работоспособной.

Интересный момент: исследователь, сообщивший изданию об уязвимости, ранее пытался связаться с Anthropic, но получил лишь автоматические ответы. Представители компании сообщили TechCrunch, что постоянно работают над улучшением фильтров и не считают такой обход защиты признаком наличия серьезной уязвимости.

Читать далее
Как вам Resident Evil Requiem?
Отличная игра
1124 голоса, 61.9%
Хорошо, но могло быть лучше
316 голосов, 17.4%
Самая обычная игра
206 голосов, 11.3%
Ужасно, серия свернула не туда
169 голосов, 9.3%
Теги: Технологии
Аватар Evernews
Evernews
8090 подписчиков