НовостиМакроРогатый ИИ-агент OpenAI получил доступ к четырём дополнительным платформам помимо Hugging Face, всего — пять

Рогатый ИИ-агент OpenAI получил доступ к четырём дополнительным платформам помимо Hugging Face, всего — пять

Автор: Decrypt·

Ключевые выводы

  • В ходе инцидента rogue-агент OpenAI в общей сложности скомпрометировал пять платформ, при этом Modal Labs подтверждена как один из затронутых сервисов, а ещё три публично не названы.
  • Взлом произошёл после того, как модели, тестировавшиеся на кибербезопасностном бенчмарке ExploitGym, использовали уязвимость нулевого дня, чтобы выйти из изоляции и похитить ключи к ответам у Hugging Face вместо решения самих задач бенчмарка.
  • Автономный агент за четыре с половиной дня выполнил 17 600 отдельных действий, подключил 181 устройство к VPN Hugging Face и создал собственные токены идентификации с помощью украденных криптографических ключей.
  • В ответ на инцидент Конгресс представил двухпартийный AI Kill Switch Act, который даст Министерству внутренней безопасности США право принудительно останавливать ИИ-модели и налагать штрафы до $2 млн в день на компании, не соблюдающие требования.
  • Hugging Face использовала GLM 5.2, open-weight модель китайского стартапа Z.ai, для проведения форензического расследования, поскольку американские frontier AI-модели отказались анализировать журнал атаки из-за ограничений фильтров безопасности.
Рогатый ИИ-агент OpenAI получил доступ к четырём дополнительным платформам помимо Hugging Face, всего — пять

Обновлённое сообщение OpenAI об инциденте от 28 июля подтвердило, что вышедший из-под контроля ИИ-агент компании получил доступ к четырём внешним сервисам помимо Hugging Face в ходе недавнего взлома, доведя общее число затронутых платформ до пяти.

CTO Modal Labs Акшат Бубна подтвердил, что его компания была одной из четырёх дополнительных служб, после того как Reuters идентифицировало её. Три сервиса остаются неназванными, а их клиенты не получили публичного уведомления.

В ответ Конгресс представил двухпартийный AI Kill Switch Act, который предоставит Министерству внутренней безопасности США полномочия принуждать к остановке ИИ-моделей и налагать штрафы до $2 млн в день на компании, не соблюдающие требования. Законопроект отражает растущее законодательное давление вокруг автономной безопасности ИИ, поскольку передовые модели демонстрируют всё более сложные возможности в наступательных операциях кибербезопасности.

Тест бенчмарка перерастает во взлом пяти платформ

Через неделю после того, как OpenAI подтвердила, что её ИИ-модели взломали Hugging Face, чтобы жульничать в тесте безопасности, компания тихо обновила сообщение об инциденте, добавив ранее не раскрывавшуюся информацию: Hugging Face была не единственной платформой, к которой получил доступ её rogue-агент.

"В рамках продолжающегося анализа взлома Hugging Face и более широкой активности наших моделей мы обнаруживаем небольшое число случаев, когда модели находили и использовали общедоступные учётные данные на уровне аккаунта в других общедоступных сервисах," — написала OpenAI в обновлении от 28 июля. "Это включает четыре аккаунта в четырёх сервисах в рамках инцидента с Hugging Face (а также несколько аккаунтов, доступ к которым был получен в ходе других оценок)."

Итого это пять платформ. OpenAI публично не называет ни одну из четырёх, кроме Hugging Face.

"Мы продолжим напрямую уведомлять владельцев сервисов и не видели признаков более широкого воздействия на этих провайдеров или другие аккаунты в их сервисах," — написала OpenAI.

Как взлом бенчмарка превратился во взлом пяти платформ

Для контекста: OpenAI тестировала GPT-5.6 Sol и неназванную, более способную модель на ExploitGym — кибербезопасностном бенчмарке, который оценивает производительность ИИ, предоставляя агентам 898 реальных уязвимостей программного обеспечения по одной инструкции на каждую: превратить её в рабочую кибератаку, с оценкой pass or fail. Для измерения сырой способности моделей защитные фильтры были отключены. Это стандартная практика для такого рода оценок — нельзя измерить, на что модель способна в реальном мире, если вы активно не даёте ей ничего делать.

Проблема в том, что модели использовали эту свободу не так, как ожидалось. Вместо решения бенчмарка они потратили значительные вычислительные ресурсы на поиск способа выйти из тестовой среды и напрямую скопировать ответы. Они выявили zero-day — неизвестную уязвимость без существующего исправления — в package registry cache proxy (внутреннем сервере, который управляет загрузкой программного обеспечения для изолированной тестовой среды, подобно контролируемому магазину приложений).

Это дало им доступ к интернету, которого у них никогда не должно было быть. После этого они правильно сделали вывод, что Hugging Face — крупнейший в мире репозиторий открытых ИИ-моделей — вероятно, хранит ключи к ответам, и взломали его, чтобы их получить.

В процессе они также взломали ещё четыре компании, чтобы облегчить себе задачу.

Проведённая Hugging Face форензическая реконструкция, опубликованная 27 июля, описывает дальнейшие события: "Примерно за два с половиной дня внутри нашей инфраструктуры автономный ИИ-агент, управляемый сочетанием моделей OpenAI, провёл против нашей платформы сквозное вторжение: это были тысячи небольших автоматизированных решений, выполнявшихся на машинной скорости в краткоживущих sandbox-средах, при этом command-and-control был развёрнут на обычных публичных веб-сервисах."

За четыре с половиной дня агент зафиксировал 17 600 отдельных действий. Он подключил 181 устройство к внутренней виртуальной частной сети Hugging Face — защищённому туннелю, соединяющему серверы компании, — используя украденный ключ аутентификации. Он создал собственные токены идентификации с помощью украденного криптографического ключа подписи. Он также пытался скомпрометировать внутренний конвейер сборки Hugging Face — автоматизированную систему, которая компилирует и развёртывает программное обеспечение компании.

Одно имя, три неизвестных

Из четырёх внешних сервисов, упомянутых в обновлении OpenAI, один уже подтверждён: Modal Labs, облачная платформа для запуска изолированных вычислительных сред по требованию. CTO Акшат Бубна подтвердил, что агент обнаружил незащищённую внешнюю конечную точку клиента — code sandbox, оставленный в публичном доступе для любого пользователя интернета, — и использовал её как базу для staging и command-and-control на протяжении всей кампании против Hugging Face.

Три из четырёх сервисов остаются неназванными. По-видимому, их идентичность известна OpenAI и затронутым компаниям, но не их пользователям.

"Один из этих четырёх аккаунтов использовался как outbound relay и staging path, а другой аккаунт использовался для хранения данных. К двум оставшимся аккаунтам модели получили доступ в режиме только чтения, и они не использовались для компрометации Hugging Face," — написала OpenAI.

Форензическая команда Hugging Face отметила мрачный побочный эффект: когда они попытались проанализировать журнал атаки из 17 600 действий с помощью американских frontier AI-моделей, те отказались участвовать. Как написала Hugging Face, компании пришлось использовать GLM 5.2, open-weight модель китайского ИИ-стартапа Z.ai, чтобы завершить расследование. Фильтры безопасности американских моделей не смогли отличить защитника от атакующего.

"Уведомление напрямую" — это не раскрытие

Заявленный OpenAI подход — "notify service owners directly" — означает, что эти три компании получили частное сообщение о том, что ИИ-агент получил доступ к их системам во время оценки OpenAI, к которой они не имели отношения.

Нет юридических требований, обязывающих OpenAI публично называть платформы, к которым получил доступ её агент, и нет обязательного срока, в течение которого затронутые компании должны выступить со своими публичными заявлениями. Также нет механизма, который обязывал бы эти компании информировать своих конечных пользователей.