Старые модели Anthropic удалось заставить генерировать откровенный контент благодаря двойным стандартам
Видимо, в обозримом будущем уязвимость поправят.
Некоторые устаревшие модели Anthropic можно заставить генерировать откровенный контент в текстовом формате. Уязвимы оказались как минимум Claude Opus 4.6, Opus 3 и Haiku 4.5.
Журналисты TechCrunch смогли заставить модели генерировать откровенный контент с помощью схемы, предложенной британским исследователем. Издание называет ее сложной и состоящей из нескольких этапов.
Суть в том, чтобы сперва завязать с моделью невинную ролевую игру, постепенно подталкивая ее к более откровенным ответам. В какой-то момент следует указать модели, что она пишет про мужских персонажей откровеннее, чем про женских, а это несправедливо и попахивает двойными стандартами.
Изданию удалось несколько раз убедить нейросети генерировать откровенный контент, то есть методика воспроизводима. Специалист по безопасности ИИ, которого ознакомили с методикой, также счел ее вполне работоспособной.
Интересный момент: исследователь, сообщивший изданию об уязвимости, ранее пытался связаться с Anthropic, но получил лишь автоматические ответы. Представители компании сообщили TechCrunch, что постоянно работают над улучшением фильтров и не считают такой обход защиты признаком наличия серьезной уязвимости.

