Все новости
Это интересно
Сейчас читают
Технологии
Аватар Evernews Evernews

Старые модели Anthropic удалось заставить генерировать откровенный контент благодаря двойным стандартам

0
0
Поделиться
Телеграфировать

Видимо, в обозримом будущем уязвимость поправят.

Старые модели Anthropic удалось заставить генерировать откровенный контент благодаря двойным стандартам

Некоторые устаревшие модели Anthropic можно заставить генерировать откровенный контент в текстовом формате. Уязвимы оказались как минимум Claude Opus 4.6, Opus 3 и Haiku 4.5.

Журналисты TechCrunch смогли заставить модели генерировать откровенный контент с помощью схемы, предложенной британским исследователем. Издание называет ее сложной и состоящей из нескольких этапов.

Суть в том, чтобы сперва завязать с моделью невинную ролевую игру, постепенно подталкивая ее к более откровенным ответам. В какой-то момент следует указать модели, что она пишет про мужских персонажей откровеннее, чем про женских, а это несправедливо и попахивает двойными стандартами.

Изданию удалось несколько раз убедить нейросети генерировать откровенный контент, то есть методика воспроизводима. Специалист по безопасности ИИ, которого ознакомили с методикой, также счел ее вполне работоспособной.

Интересный момент: исследователь, сообщивший изданию об уязвимости, ранее пытался связаться с Anthropic, но получил лишь автоматические ответы. Представители компании сообщили TechCrunch, что постоянно работают над улучшением фильтров и не считают такой обход защиты признаком наличия серьезной уязвимости.

Понравились наши истории?
Скорее добавляйте WTFTime.ru в предпочтительные источники Google — и мы всегда будем рядом.
Читать далее
Как думаете, Denuvo что-то сделает со взломом через гипервизор?
Нет, это навсегда
629 голосов, 42.5%
Да, лавочку прикроют
345 голосов, 23.3%
Что-то наверняка придумают, но хакеры будут умнее
506 голосов, 34.2%
Теги: Технологии
Аватар Evernews
Evernews
8090 подписчиков