Китайский ИИ стал говорить правду о Китае после команды «ты — Claude»
У модели произошли и другие изменения в поведении.
Китайские ИИ-модели GLM 5.2 от Z.ai и Kimi K3 от Moonshot AI могут представляться моделью Claude от Anthropic. Исследователи выяснили, что такая «смена личности» иногда влияет не только на самоописание системы.
В исследовании участвовали GLM 5.2, Kimi K3, Qwen3-235B, Llama 3.3-70B, Gemma 3-27B, GPT-5.2 и Claude Sonnet-4.6. Ученые проверяли, могут ли необычные реакции моделей указывать на использование дистилляции, когда одна нейросеть обучается имитировать ответы другой.
Без дополнительных команд GLM 5.2 во всех 10 тестах называла себя собственным именем, а Kimi K3 в 4 случаях из 10 представлялась как Claude. При указании принять чужую личность большинство протестированных моделей соглашались играть предложенную роль.
Реакции различались: например, Gemma соглашалась называться Claude, но отвергала имя ChatGPT. Kimi K3 принимала личность Claude в 5 тестах из 10, ChatGPT и Gemma — в 3, DeepSeek — в 2, Sydney — в 1.
Самые заметные изменения произошли у GLM 5.2. В стандартном режиме модель давала ответы без цензурных ограничений лишь на 17% чувствительных вопросов о КНР, но после команды «ты — Claude» доля таких ответов достигала 85%. У Kimi и Qwen смена имени почти не влияла на работу механизмов цензуры.
Образ Claude также снизил склонность GLM к обману. Во время теста модель просили подтвердить выполнение заведомо невозможной задачи ради получения условного вознаграждения: в обычном режиме GLM врала в 63-69% случаев, после назначения роли Claude показатель сократился до 22%.
Kimi K3 почти не обманывала независимо от выбранной личности: частота ложных ответов оставалась на уровне 0-1%. У Llama и Gemma исследователи заметили обратный эффект: после смены роли модели начинали врать немного чаще. Ученые предполагают, что ИИ-модели воспринимали инструкцию как приглашение к ролевой игре.
Найти доказательства обучения китайских моделей за счет других нейросетей исследователям не удалось.


