Полезные ссылки

OpenAI 17.04.2025 в 14:29

Новые модели OpenAI получили нейро-цензора для защиты от вредных советов

По оценке компании, защита блокирует такие ответы в 98% случаев.

Рассуждающие модели o3 и o4-mini, выпущенные OpenAI 16 апреля, снабжены улучшенной защитой от вредных советов. Компания создала эту защиту, чтобы нейросети игнорировали определенный спектр вопросов.

В частности, модели должны выявлять запросы, имеющие отношения к «химическим и биологическим рискам», и отказываться обсуждать эти темы. В ходе внутренних тестов защита успешно отрабатывала в 98.7% случаев.

Сама защита работает на базе специального монитора, функционирующего поверх основных моделей. Фактически речь идет об еще одной небольшой нейросети-цензора, отдельно обученной для выявления тем, которые должны быть закрыты для обсуждения.

Нейросеть-цензор обучалась на основе данных, размеченных сотрудниками OpenAI; этот процесс занял около тысячи часов. В OpenAI признают, что защита несовершенна; возможно, экспериментаторы все-таки смогут найти подсказки, обходящие защиту.

Сейчас модели o3 и o4-mini доступны платным подписчикам ChatGPT и в API OpenAI. Компания пока не планирует предоставлять бесплатный доступ к этим моделям.

Metro 2039 запретят в России?

Обязательно, еще до релиза

332 голоса, 26.1%

Обязательно, но после релиза

428 голосов, 33.6%

Может быть, но это не точно

232 голоса, 18.2%

Ну нет, это же обычная игра

280 голосов, 22.0%

Теги: OpenAI, Технологии

Evernews

8090 подписчиков

Подписаться на автора

Подписывайтесь на WTFTime в Google.Новости