Anthropic пообещала не менять в тексте важные слова для создания водяных знаков
Подход будет похож на тот, что использует Google DeepMind.
Компания Anthropic пояснила, как будет работать система добавления водяных знаков в тексты, генерируемые ее нейросетями. В Anthropic обещают, что для добавления водяных знаков будут меняться только неважные слова.
Технология основана на подходе, описанном Google DeepMind в исследовании SynthID-Text. При генерации ответа языковая модель выбирает следующий токен из нескольких подходящих вариантов. Если разные слова почти не меняют смысл фразы, алгоритм сможет предпочесть один из них, создавая в тексте статистическую сигнатуру.
Обнаружить такую маркировку можно будет с помощью цифрового ключа. При этом Anthropic подчеркивает, что вмешательство не должно затрагивать смысл, точность или читаемость ответа. Согласно тестам, проведенным компанией, заметить разницу между обычным и помеченным текстом невозможно.
В зависимости от типа текста будут вводиться дополнительные ограничения на подбор замены. Например, особенно жесткими они будут в случае генерации кода.
Водяные знаки не будут полностью устойчивы к редактированию текстов. По оценке Anthropic, после небольших правок сигнатура в основном сохранится, но глубокая переработка текста способна ее удалить.
Впрочем, в компании считают, что после настолько серьезного редактирования уже возникает отдельный вопрос о том, насколько корректно считать итоговый материал сгенерированным ИИ.
Водяные знаки не содержат каких-либо идентификаторов и предназначены лишь для определения вероятного участия Claude в создании текста. О том, когда заработает система, не сообщается.

