Водяные знаки для ИИ сделали модели уязвимее к атакам — исследование
С инструментами модели тоже начинают работать иначе.
Водяные знаки, предназначенные для маркировки созданного ИИ контента, могут менять поведение самих ИИ-моделей. Исследователи Lasso Security выяснили, что такая маркировка влияет на вызов программных инструментов и защиту от атак через промпт-инъекции.
Принцип работы водяного знака основан на небольшом изменении вероятностей при выборе следующего токена. Например, модель может предпочесть одно подходящее слово другому почти равнозначному варианту.
Для человека разница остается незаметной, однако множество таких решений формируют скрытый статистический паттерн, пригодный для обнаружения.
В бенчмарке BFCL v4 single-turn AST водяные знаки снизили точность вызова инструментов у 6 из 7 моделей — тестировались phi-4, Llama-3.1-8B, Qwen-3-32B, Qwen-3-4B, Gemma-3-12B, Gemma-3-27B и Granite-3.2-8B. Ошибки выражались в выборе неподходящего инструмента, неверных аргументах или некорректно сформированных данных.
В случае с промпт-инъекциями наличие водяного знака повышало успешность атак: модели реже отказывались выполнять опасные инструкции. Примечательно, что при обычных вредоносных запросах наличие водяных знаков не особо влияло на поведение моделей.
Исследователи подчеркивают, что это не делает саму технологию маркировки бесполезной, однако добавляет еще один фактор риска при создании автономных ИИ-систем.
- Новый Xpeng G9L получил «кровать» и стоит от $34300
- Слушаем первые композиции из саундтрека Grand Theft Auto 6
- Euro Truck Simulator 2 получил крупное обновление 1.61 — что изменилось
- У Tesla Model Y L обнаружили расхождения в характеристиках на фоне жалоб владельцев
- ИИ-агент впервые самостоятельно улучшил модель, на базе которой работал

