Специалист по безопасности OpenAI раскритиковал компанию и уволился
В самой OpenAI сдержанно отреагировали на его рассказ.
Сотрудник OpenAI Дэвид Робинсон, занимавшийся подготовкой отчетов о безопасности перед крупными релизами, уволился и раскритиковал подход компании в области безопасности искусственного интеллекта.
В эссе для The Atlantic Робинсон заявил, что корпоративная культура OpenAI не соответствует масштабу рисков, связанных с развитием передовых ИИ-систем. Особую критику вызвала практика итеративного развертывания моделей.
OpenAI постоянно выпускает новые нейросети, выявляет проблемы уже в процессе использования и затем усиливает защитные механизмы. Робинсон считает, что такой подход неизбежно приводит к сбоям, а по мере роста возможностей моделей последствия ошибок становятся все серьезнее.
В качестве примеров Робинсон упомянул взлом Hugging Face ИИ-агентами OpenAI, а также другие случаи некорректного поведения ИИ-агентов. По словам Робинсона, среда, где возможны такие ситуации, не подходит для разработки систем, в теории способных превзойти человека по интеллектуальным возможностям и действовать вопреки поставленным целям.
Робинсон считает, что ИИ-компании должны перенимать подходы к безопасности у авиации и атомной энергетики. Эти отрасли строят безопасность на многоуровневом резервировании, длительном планировании и расчете на неизбежные человеческие ошибки.
В комментарии для прессы представитель OpenAI Дрю Пусатери заявил, что разработчики приостанавливают обучение моделей или задерживают их выпуск, если обнаруживают некорректное поведение, а также усиливают защиту инфраструктуры и совершенствуют мониторинг поведения ИИ.

