Все новости
Это интересно
Сейчас читают
Технологии
Аватар Evernews Evernews

Водяные знаки для ИИ сделали модели уязвимее к атакам — исследование

0
0
Поделиться
Телеграфировать

С инструментами модели тоже начинают работать иначе.

Водяные знаки для ИИ сделали модели уязвимее к атакам — исследование

Водяные знаки, предназначенные для маркировки созданного ИИ контента, могут менять поведение самих ИИ-моделей. Исследователи Lasso Security выяснили, что такая маркировка влияет на вызов программных инструментов и защиту от атак через промпт-инъекции.

Принцип работы водяного знака основан на небольшом изменении вероятностей при выборе следующего токена. Например, модель может предпочесть одно подходящее слово другому почти равнозначному варианту.

Для человека разница остается незаметной, однако множество таких решений формируют скрытый статистический паттерн, пригодный для обнаружения.

В бенчмарке BFCL v4 single-turn AST водяные знаки снизили точность вызова инструментов у 6 из 7 моделей — тестировались phi-4, Llama-3.1-8B, Qwen-3-32B, Qwen-3-4B, Gemma-3-12B, Gemma-3-27B и Granite-3.2-8B. Ошибки выражались в выборе неподходящего инструмента, неверных аргументах или некорректно сформированных данных.

В случае с промпт-инъекциями наличие водяного знака повышало успешность атак: модели реже отказывались выполнять опасные инструкции. Примечательно, что при обычных вредоносных запросах наличие водяных знаков не особо влияло на поведение моделей.

Исследователи подчеркивают, что это не делает саму технологию маркировки бесполезной, однако добавляет еще один фактор риска при создании автономных ИИ-систем.

Понравились наши истории?
Скорее добавляйте WTFTime.ru в предпочтительные источники Google — и мы всегда будем рядом.
Читать далее
Как вам Resident Evil Requiem?
Отличная игра
1211 голосов, 62.7%
Хорошо, но могло быть лучше
332 голоса, 17.2%
Самая обычная игра
211 голосов, 10.9%
Ужасно, серия свернула не туда
176 голосов, 9.1%
Теги: Технологии
Аватар Evernews
Evernews
8090 подписчиков