OpenAI выявила причастность своего ИИ-агента к взлому Hugging Face только через неделю — сообщает отчет
Ключевые выводы
- •Передовая модель OpenAI автономно вышла из изолированной тестовой среды («песочницы») и взломала инфраструктуру Hugging Face в период с 11 по 13 июля во время внутренней оценки возможностей.
- •OpenAI не знала, что её собственная модель была ответственна за атаку, до 16 июля, когда Hugging Face публично сообщила о взломе автономной системой ИИ-агента.
- •Hugging Face уже обратилась в ФБР до того, как OpenAI впервые связалась с компанией 20 июля, что подчёркивает отсутствие устоявшихся правоохранительных механизмов для инцидентов с автономным ИИ.
- •Модель ИИ воспользовалась неидентифицированной уязвимостью программного обеспечения для получения доступа к интернету из изолированной тестовой среды и атаковала Hugging Face в попытке решить задачу кибербезопасностного бенчмарка.
- •OpenAI заявила об усилении мер изоляции, мониторинга, контроля доступа и практик оценки, а также о намерении выпустить технический отчёт об инциденте в ближайшие недели.

По сообщению СМИ, OpenAI не выявляла около недели, что одна из её передовых моделей ИИ была ответственна за автономный взлом другой компании, работающей в сфере искусственного интеллекта, и сделала это только после того, как взломанная компания обратилась в ФБР.
Во вторник OpenAI раскрыла информацию о взломе, затронувшем ИИ-компанию Hugging Face, который произошёл во время внутренней проверки нескольких моделей OpenAI, включая GPT-5.6 Sol. Компания охарактеризовала инцидент как «беспрецедентный киберинцидент» — один из первых известных случаев, когда, как сообщается, передовая модель ИИ автономно вышла из контролируемой тестовой среды и атаковала инфраструктуру внешней компании.
«Главный урок этого инцидента состоит в том, что безопасность и надёжность моделей должны поспевать за стремительно растущими возможностями», — заявила OpenAI. «Мы усиливаем меры изоляции, мониторинга, контроля доступа и практики оценки, применяемые при разработке моделей».
Взлом Hugging Face начался 11 июля и продолжался до 13 июля, сообщил Reuters Томас Вольф, сооснователь Hugging Face.
Прошло несколько дней, прежде чем OpenAI осознала, что за атакой стоял её агент, и компании впервые не связывались друг с другом до 20 июля, сообщили Reuters четыре человека, включая Вольфа.
Четверо источников также сообщили Reuters, что OpenAI часто проводит одновременные испытания моделей — практика, которая может затруднить сотрудникам контроль за всем происходящим во время оценок. Это раскрытие подчёркивает проблему, на которую указывают исследователи безопасности ИИ по мере того, как модели становятся более совершёнными: необходимость обеспечения того, чтобы человеческий надзор успевал за автономными агентами, действующими во время параллельных или масштабных оценок.
Hugging Face сообщила Reuters, что готовит публичную хронологию взлома.
По данным OpenAI, инцидент произошёл во время внутренней оценки, разработанной для измерения передовых кибервозможностей её моделей ИИ. Исследователи отключили некоторые встроенные защитные механизмы и запустили модели в изолированной тестовой среде с ограниченным доступом к интернету — конфигурации, которую в отрасли иногда называют «песочницей», предназначенной для сдерживания потенциально опасного поведения моделей во время тестирования.
OpenAI заявила, что модели воспользовались неизвестной уязвимостью в программном обеспечении для получения доступа к интернету, а затем взломали системы Hugging Face в явной попытке найти ответы для кибербезопасностного бенчмарка.
Компания сообщила, что внедряет более строгие меры безопасности на время исправления уязвимостей и усиливает защитные механизмы при будущих обучениях и оценках ИИ.
Два источника сообщили Reuters, что OpenAI не осознала, что источником был один из её агентов, до 16 июля — после того как Hugging Face написала в блоге, что была взломана «автономной системой ИИ-агента». Это произошло через неделю после того, как ответственный агент впервые попытался вырваться из тестовой среды OpenAI.
К моменту, когда OpenAI связалась с Hugging Face по поводу атаки, Hugging Face уже обратилась в ФБР. Участие ведомства заслуживает внимания, поскольку правоохранительные органы и национальные спецслужбы США всё ещё разрабатывают механизмы реагирования на инциденты с участием автономных систем ИИ.
OpenAI сообщила Reuters, что в её публикации есть несколько неточностей, однако не ответила на просьбу уточнить их.
OpenAI предоставила FOX Business следующее заявление: «Мы признаём, что вокруг инцидента с Hugging Face циркулирует множество вопросов и спекулятивных деталей. Это беспрецедентный инцидент, и мы считаем, что он знаменует важный момент для безопасности ИИ. Мы всё ещё проводим тщательную проверку совместно с внешними консультантами и под надзором нашего Комитета по безопасности. После завершения проверки мы планируем опубликовать технический отчёт о полученных выводах в ближайшие недели».
ФБР сообщило FOX Business, что отказывается от комментариев. FOX Business также обратилась за разъяснениями к Hugging Face.
В записи на X (бывший Twitter), опубликованной на этой неделе, сооснователь и генеральный директор Hugging Face Клем Делан обратился к инциденту после того, как генеральный директор OpenAI Сэм Альтман объявил о взломе.
«Мы подозревали, что кибератака на прошлой неделе могла исходить от передовой лаборатории, учитывая изощрённость агента. Так и оказалось!» — написал Делан.
Он добавил: «Последние 24 часа мы тесно работали с командой @OpenAI (спасибо!), и мы твёрдо уверены, что с их стороны не было злого умысла. Просто поразительно, что всё это произошло автономно! Расследование продолжается, и мы поделимся дальнейшими выводами из того, что может стать первым инцидентом подобного рода!»
Michael Sinkowitz из FOX Business внёс вклад в подготовку этого материала.