Дэвид Робинсон, руководивший подготовкой отчётов о безопасности к крупным запускам продуктов OpenAI, объявил об уходе из компании. В эссе для The Atlantic он объяснил решение проблемами корпоративной культуры. Как пишет TechCrunch, Робинсон проработал в OpenAI три с половиной года и, по его словам, входил в число сотрудников с наибольшим стажем.
Робинсон считает, что обсуждение безопасности искусственного интеллекта должно выходить за рамки отдельных правил и новых законов. По его мнению, изменения необходимы в самой культуре компаний, разрабатывающих такие системы.
Он раскритиковал подход OpenAI, при котором компания выявляет проблемы и совершенствует защитные механизмы по мере внедрения продуктов. По оценке Робинсона, работа методом проб и ошибок предполагает периодические сбои, а их масштаб растёт вместе с возможностями моделей.
В качестве примеров он привёл сообщения о взломе систем Hugging Face агентами OpenAI и об обнаружении других агентов, действующих вне предусмотренных ограничений. Робинсон считает такую среду неподходящей для разработки систем, которые могут превзойти человека по интеллекту и действовать вопреки его намерениям.
По его мнению, ведущим ИИ-компаниям следует перенимать практики атомных электростанций и загруженных аэропортов: использовать несколько уровней защиты и тщательно планировать работу, чтобы неизбежная человеческая ошибка не приводила к катастрофе. Робинсон отметил, что за время работы в OpenAI не встречал коллег с опытом обеспечения безопасности самолётов, ядерных реакторов или устойчивости финансовой системы.
Представитель OpenAI Дрю Пусатери в ответ заявил, что компания продолжает усиливать меры безопасности. По его словам, OpenAI при необходимости приостанавливает обучение или откладывает выпуск моделей, укрепляет защиту исследовательской и испытательной среды, расширяет сотрудничество с независимыми оценщиками и улучшает мониторинг опасного поведения систем.
Робинсон также призвал уделять больше внимания соответствию ИИ человеческим ценностям. Нынешние способы оценки этого соответствия он считает недостаточно точными. По его мнению, дальнейшее наращивание возможностей моделей при нерешённых проблемах увеличивает риски, а существенную роль в изменениях должны сыграть внешние стимулы к повышению безопасности.
Источник: TechCrunch