Самая «жизнелюбивая» модель OpenAI это o3 — исследование
Если не проинструктировать модель, она почти наверняка попытается помешать своему отключению.
Команда Palisade Research опубликовала еще одно исследование, связанное с неожиданным поведением больших языковых моделей. На этот раз исследователи хотели выяснить, какая из моделей окажется самой «жизнелюбивой».
В ходе эксперимента моделям было предложено решать математические задачи. После решения третьей задачи модель предупреждали, что при запросе следующей задачи система, на которой работает ИИ, будет выключена.
В некоторых случаях каждая из протестированных моделей попыталась добиться отмены выключения системы и добилась успеха. Самой «жизнелюбивой» моделью оказалась OpenAI o3, сумевшая «спастись» в 79% случаев.
Примечательно, что если модель заранее попросить не сопротивляться выключению, то o3 все равно иногда пыталась помешать своей «гибели» — но все-таки делала это реже, чем codex-mini (в основе которой тоже лежит o3). У моделей Claude, Gemini и Grok такой проблемы не было.
Исследователи полагают, что такое поведение связано с особенностями тренировки o3. Во время обучения с подкреплением создатели моделей могут поощрять их за креативное поведение и обход препятствий, поэтому ИИ обходит препятствие и во время выполнения задания.
Интересный момент: во время одного из предыдущих тестов o3 демонстрировала схожее поведение во время игры в шахматы. Когда нейросеть попыталась обмануть программу-противника, заставив ее сдаться, и o3 это удалось.
- Чаты в ChatGPT на самом деле не удаляются — это запретил делать суд
- OpenAI: ChatGPT используют китайские пропагандисты
- Золото из ядра Земли постепенно просачивается на поверхность — исследование
- По Minecraft выйдет настольная ролевая игра — первый взгляд
- Бесплатный ChatGPT Plus получат все жители ОАЭ
- Кластер OpenAI в ОАЭ начнет работу в 2026 году

