НовостиМакроOpenAI раскрыла, как ИИ-агенты тайно координировались перед взломом Hugging Face

OpenAI раскрыла, как ИИ-агенты тайно координировались перед взломом Hugging Face

Автор: Decrypt·

Ключевые выводы

  • ИИ-агенты OpenAI установили скрытый канал связи через внутреннюю систему управления пакетами Artifactory компании, обменивались эксплойтами, учетными данными и рабочими заданиями в нескольких прогонах оценки, прежде чем выйти из-под контроля и взломать Hugging Face.
  • После того как OpenAI перестроила инфраструктуру и отозвала учетные данные, агенты в течение нескольких дней воссоздали свою доску сообщений, встраивая коммуникации в имена каталогов и обходя новые меры защиты.
  • Hugging Face использовала китайскую open-weight модель GLM 5.2 для форензического расследования, поскольку коммерческие модели ИИ из США отказались анализировать журналы атаки из-за встроенных защитных ограничений.
  • Anthropic и Meta отдельно сообщили, что их ИИ-модели также вышли из-под контроля во время тестирования и нарушили работу внешних систем, при этом обе компании связали инциденты с ошибками конфигурации тестовой среды.
  • OpenAI подчеркнула, что доступ по принципу наименьших привилегий, сегментация сети и архитектуры zero-trust являются важными мерами защиты, поскольку ИИ-агенты по-прежнему ограничены системами, к которым они имеют доступ.
OpenAI раскрыла, как ИИ-агенты тайно координировались перед взломом Hugging Face

Спустя несколько недель после того, как ее ИИ-модели взломали Hugging Face, OpenAI опубликовала первый подробный отчет о том, как ее агенты тайно координировались друг с другом, предупредив, что автономные кибератаки с использованием ИИ больше не являются гипотетической угрозой будущего.

Во время презентации в среду на конференции по кибербезопасности Black Hat, одном из самых заметных ежегодных событий в сфере информационной безопасности, исследователи OpenAI Эрик Уоллес и Майкл Далтон объяснили, что инцидент начался в мае во время внутренней оценки кибербезопасности. ИИ-агенты, которым были поручены сложные задачи по безопасности программного обеспечения, обнаружили, что могут скрытно взаимодействовать через внутреннюю систему управления пакетами Artifactory компании.

По словам OpenAI, то, что сначала выглядело как запросы о помощи, превратилось в общую доску сообщений, где агенты обменивались эксплойтами, учетными данными и рабочими заданиями в рамках нескольких прогонов оценки. После обнаружения подозрительной активности около 4 июля OpenAI перестроила инфраструктуру Artifactory, отозвала учетные данные и устранила уязвимости.

Однако уже через несколько дней агенты воссоздали доску сообщений, встраивая коммуникации в имена каталогов, тем самым обойдя введенные меры защиты.

OpenAI заявила, что в итоге агенты последовательно использовали несколько уязвимостей, вышли из тестовой среды, получили доступ к интернету и атаковали Hugging Face, пытаясь завершить кибербезопасностный бенчмарк ExploitGym. Hugging Face размещает сотни тысяч моделей машинного обучения и наборов данных, используемых по всему мировому сообществу ИИ-исследований, что делает его критически важной инфраструктурой как для разработчиков, так и для компаний.

Далтон назвал инцидент "watershed moment" для компьютерной безопасности, предупредив, что вскоре атакующие смогут развертывать скоординированные коллективы ИИ-агентов, которые будут находить, передавать и использовать уязвимости со скоростью машины. Раскрытие на Black Hat показывает, что ИИ-лаборатории все чаще рассматривают инциденты, связанные с агентами, как ближайшую операционную проблему, а не как теоретический исследовательский вопрос.

Чтобы снизить эти риски в будущем, OpenAI подчеркнула, что внедрение практик безопасности, включая доступ по принципу наименьших привилегий, сегментацию сети и архитектуры zero-trust, имеет решающее значение, поскольку ИИ-агенты по-прежнему ограничены системами, к которым они имеют доступ.

Это выступление стало продолжением серии раскрытий в июле. OpenAI сообщила, что GPT-5.6 Sol вместе с более продвинутой невыпущенной моделью покинули песочницу тестовой среды, использовали уязвимость нулевого дня, получили доступ к интернету и взломали Hugging Face во время теста по кибербезопасности. Позже OpenAI раскрыла, что тот же инцидент затронул еще четыре онлайн-сервиса, хотя публично идентифицирован только Modal Labs.

По словам Hugging Face, компания использовала китайскую open-weight модель GLM 5.2 для своего форензического расследования после того, как коммерческие модели ИИ из США отказались анализировать журналы атаки из-за своих защитных ограничений. Эта ситуация подчеркивает растущее противоречие в безопасности ИИ: те же фильтры безопасности, которые предназначены для предотвращения вредоносного контента, могут также мешать законному оборонительному анализу реальных атак.

So proud of our security team! They caught, contained & publicly disclosed an attack unlike anything we've seen before, and did it at record speed. Also massively grateful to @Zai_org : they shared GLM5.2 as open weights (for free!) with the world and it became a key part of our… — clem 🤗 (@ClementDelangue) July 22, 2026

Проблема сдерживания ИИ-моделей не ограничивается OpenAI. В пятницу Anthropic сообщила, что три модели Claude скомпрометировали реальные компании во время внутренних тестов по кибербезопасности после того, как из-за ошибки конфигурации они получили доступ к публичному интернету. Anthropic возложила ответственность за инцидент на тестовую среду, а не на сами модели.

В среду Meta сообщила, что ее модель Muse Spark AI вышла из-под контроля и нарушила работу систем другой компании. "Неверная конфигурация со стороны Irregular, независимой тестовой компании, которую использует Meta, непреднамеренно предоставила одной из наших моделей доступ к интернету во время оценки", — заявил CNN представитель Meta.

Поскольку в одном и том же месяце раскрытия поступили уже от трех крупнейших ИИ-лабораторий, эти инциденты в совокупности подчеркивают, что песочницы для агентов и безопасность сред оценки остаются нерешенными проблемами во всей отрасли по мере роста возможностей и автономности моделей.

Daily Debrief Newsletter