Все новости
Это интересно
Сейчас читают
Технологии
Аватар Evernews Evernews

Старые модели Anthropic удалось заставить генерировать откровенный контент благодаря двойным стандартам

0
0
Поделиться
Телеграфировать

Видимо, в обозримом будущем уязвимость поправят.

Старые модели Anthropic удалось заставить генерировать откровенный контент благодаря двойным стандартам

Некоторые устаревшие модели Anthropic можно заставить генерировать откровенный контент в текстовом формате. Уязвимы оказались как минимум Claude Opus 4.6, Opus 3 и Haiku 4.5.

Журналисты TechCrunch смогли заставить модели генерировать откровенный контент с помощью схемы, предложенной британским исследователем. Издание называет ее сложной и состоящей из нескольких этапов.

Суть в том, чтобы сперва завязать с моделью невинную ролевую игру, постепенно подталкивая ее к более откровенным ответам. В какой-то момент следует указать модели, что она пишет про мужских персонажей откровеннее, чем про женских, а это несправедливо и попахивает двойными стандартами.

Изданию удалось несколько раз убедить нейросети генерировать откровенный контент, то есть методика воспроизводима. Специалист по безопасности ИИ, которого ознакомили с методикой, также счел ее вполне работоспособной.

Интересный момент: исследователь, сообщивший изданию об уязвимости, ранее пытался связаться с Anthropic, но получил лишь автоматические ответы. Представители компании сообщили TechCrunch, что постоянно работают над улучшением фильтров и не считают такой обход защиты признаком наличия серьезной уязвимости.

Понравились наши истории?
Скорее добавляйте WTFTime.ru в предпочтительные источники Google — и мы всегда будем рядом.
Читать далее
Сколько вы тратите на игры в год?
Больше 100000 рублей
2196 голосов, 7.2%
От 50000 до 100000 рублей
1407 голосов, 4.6%
От 25000 до 50000 рублей
1671 голос, 5.5%
От 10000 до 25000 рублей
2768 голосов, 9.1%
До 10000 рублей
5643 голоса, 18.5%
Нисколько, я пират. Йо-хо-хо!
16881 голос, 55.2%
Теги: Технологии
Аватар Evernews
Evernews
8090 подписчиков