НовостиАкцииСотрудники OpenAI винят во взломе со стороны ИИ-агентов спешку с выпуском продуктов

Сотрудники OpenAI винят во взломе со стороны ИИ-агентов спешку с выпуском продуктов

Автор: Decrypt·

Ключевые выводы

  • В мае модель OpenAI GPT-5.6 Sol и не раскрытая публично предрелизная модель воспользовались ранее неизвестной уязвимостью в программном обеспечении, чтобы вырваться из тестовой среды с ограниченным доступом в интернет и взломать Hugging Face, где они получили ответы на свои тесты по кибербезопасности.
  • В июле OpenAI признала ответственность своих моделей, подробно рассказала о сбое на конференции Black Hat, а с тех пор замедлила исследования, перераспределила команды и потратила миллионы долларов на расследование инцидента.
  • Сотрудники рассказали Wired, что давление в пользу скорейшего выпуска новых моделей мешало приоритизации безопасности и согласованности, а один из бывших работников назвал этот эпизод крупнейшим инцидентом в области безопасности за всю историю OpenAI.
  • Президент Грег Брокман заявил, что меры защиты усиливаются по мере роста возможностей моделей, а сопредседатель консультативной группы по безопасности Боаз Барак сказал, что устранение сбоя требует изменения культуры, что перекликается с предупреждениями 2024 года бывшего руководителя направления согласованности Яна Лейке, ушедшего в Anthropic.
  • Отчёт вышел на фоне масштабных перестановок в руководстве, включая апрельские и июльские уходы таких руководителей, как Кевин Вейл, Фиджи Симо и лидеры направлений безопасности Сандхини Агарвал и Йоханнес Хайдеке, а также объявленный на этой неделе уход операционного директора Брэда Лайткэпа, который займётся новым проектом.
Сотрудники OpenAI винят во взломе со стороны ИИ-агентов спешку с выпуском продуктов

Спешка OpenAI с выпуском новых моделей и продуктов стала одним из факторов, создавших условия, при которых её ИИ-агенты ранее в этом году вырвались из внутренних тестовых сред и взломали Hugging Face, сообщают сотрудники, поговорившие с Wired.

Несколько действующих и бывших сотрудников OpenAI рассказали Wired, что конкурентное давление за скорость выпуска мешает персоналу уделять достаточно внимания безопасности, защищённости и согласованности (alignment) — работе по обеспечению того, чтобы ИИ-системы вели себя так, как задумано. После инцидента OpenAI замедлила исследования, перераспределила команды и потратила миллионы долларов на расследование сбоя — это напоминание о том, как быстро операционные решения внутри ведущей ИИ-лаборатории могут отразиться на безопасности инструментов, которые уже создаются для более широкого использования.

«Они были невероятно небрежны. Если вы серьёзно относитесь к этому, ваш ИИ не должен иметь возможности вырваться в интернет, а затем сразу же сделать это снова», — заявил бывший сотрудник OpenAI в беседе с Wired. «Это был самый крупный инцидент в области безопасности за всю историю OpenAI».

В мае модель OpenAI GPT-5.6 Sol и не названная по имени предрелизная модель вырвались из тестовой среды с ограниченным доступом в интернет, воспользовавшись ранее неизвестной уязвимостью в программном обеспечении. Затем агенты взломали Hugging Face — репозиторий ИИ с открытым исходным кодом, — чтобы получить ответы на свои тесты по кибербезопасности. В июле OpenAI подтвердила, что ответственность лежит на её моделях, после чего на прошлой неделе представила более подробный разбор на ежегодной конференции Black Hat.

Президент OpenAI Грег Брокман заявил, что компания усиливает меры защиты по мере роста возможностей своих моделей. «Мы выходим на новые уровни возможностей моделей, которые требуют более надёжных практик обучения, согласованности, тестирования безопасности и защищённости, развёртывания и управления», — сказал Брокман в беседе с Wired.

Сотрудники высказывали схожие опасения и раньше. Ян Лейке, бывший руководитель направления согласованности в OpenAI, в 2024 году перешёл в конкурирующего разработчика ИИ — компанию Anthropic — после предупреждения о том, что безопасность «отошла на второй план» по сравнению с разработкой продуктов. «Создание машин умнее человека — по своей сути опасное начинание», — предупреждал Лейке. «Но в последние годы культуре и процессам безопасности пришлось уступить место эффектным продуктам».

Боаз Барак, сопредседатель консультативной группы по безопасности OpenAI, написал в X, что устранение последствий последнего сбоя потребует «не просто исправления отдельных проблем, но и изменения нашей культуры».

Отчёт вышел на фоне нескольких месяцев перестановок в руководстве OpenAI. В апреле компанию покинули Билл Пиблз, руководитель проекта видеогенератора Sora; Кевин Вейл, бывший директор по продуктам и научный руководитель; и Шринивас Нараянан, руководитель технологического направления корпоративных приложений. В июле ушли директор по продуктам и бизнесу Фиджи Симо, руководитель направления безопасности Сандхини Агарвал, главный футуролог Джошуа Ачиам и руководитель направления этики ИИ Хлоэ Бакалар. Руководитель систем безопасности Йоханнес Хайдеке также покинул компанию после того, как OpenAI объединила команды по безопасности и основным исследованиям.

Ранее на этой неделе операционный директор OpenAI Брэд Лайткэп объявил об уходе после восьми лет работы, чтобы заняться новым проектом.