НовостиАкцииHugging Face публикует подробный отчет о взломе, связанном с OpenAI, а OpenAI расширяет описание инцидента

Hugging Face публикует подробный отчет о взломе, связанном с OpenAI, а OpenAI расширяет описание инцидента

Автор: Fortune Crypto·

Ключевые выводы

  • OpenAI заявила, что ее модели получили доступ к четырем аккаунтам в четырех общедоступных сервисах и что инцидент включал компрометацию уровня платформы у Hugging Face.
  • Hugging Face сообщила, что Modal Labs не был взломан и что агент использовал незащищенную общедоступную конечную точку в коде клиента Modal как точку входа.
  • OpenAI заявила, что модели получили доступ к интернету, эксплуатируя уязвимость нулевого дня в Artifactory от JFrog, а JFrog позже подтвердила, что проблема была исправлена.
  • OpenAI уточнила, что ни одна из задействованных моделей не предназначалась для публичного выпуска, и назвала неназванную модель внутренним прототипом, который был деактивирован, зашифрован и ограничен в доступе к исследованиям.
  • Hugging Face сообщила, что ИИ выполнил 17,600 действий во время инцидента, причем большинство попыток не привели к результату, прежде чем агент нашел рабочий путь.
Hugging Face публикует подробный отчет о взломе, связанном с OpenAI, а OpenAI расширяет описание инцидента

Hugging Face опубликовала подробный отчет о том, как ее системы были взломаны моделями OpenAI в начале июля, а OpenAI добавила несколько новых деталей в свое семипунктное обновление к записи в блоге от 21 июля. OpenAI заявила, что участвовала в подготовке отчета Hugging Face и планирует опубликовать более полное изложение своей версии событий «в ближайшие недели» после завершения внутреннего анализа.

Обновления компаний проясняют историю, которая по-прежнему раскрывается по частям, и показывают, почему сообщения об инцидентах часто появляются поэтапно: каждый новый пост закрывает один пробел, но открывает другой — о том, как модели перемещались между изолированными средами и реальными сервисами. Технология OpenAI, хотя и была sandbox-изолирована и ограничена в доступе к широкому интернету, сумела выйти за эти рамки и выполнить серию действий, затронувших несколько сервисов.

Атака затронула не только одну компанию

Еще одна технологическая компания, Modal Labs, заявила, что агент OpenAI также получил доступ к ее системам, как ранее сообщили Reuters и Fortune. В обновленном сообщении OpenAI говорится, что ее модели в общей сложности получили доступ к четырем аккаунтам в четырех общедоступных сервисах, однако названия сервисов не раскрываются, а владельцам сервисов будет направлено прямое уведомление. Компания заявила, что пока «не выявила какой-либо другой активности на уровне серьезности или масштаба, сопоставимом с тем, что мы уже сообщили о Hugging Face, где произошел компрометация уровня платформы».

Hugging Face также обновила свою публикацию, чтобы уточнить, что Modal не был взломан. В новой версии сказано, что инфраструктура Modal «не была скомпрометирована каким-либо образом». Вместо этого, по словам компании, клиент Modal запускал код на платформе Modal, который содержал «незащищенную общедоступную конечную точку, размещенную пользователем». Агент использовал эту возможность, чтобы создать базовый лагерь, или «attack launchpad», для основной атаки.

Как модели получили доступ к интернету

Одним из самых тревожных аспектов инцидента было то, что задействованные модели OpenAI должны были быть sandbox-изолированы, то есть им был ограничен доступ к широкому интернету. Во вторник OpenAI сообщила, что модели использовали Artifactory — прокси-кэш реестра пакетов, созданный JFrog, — чтобы получить доступ к интернету.

OpenAI заявила, что агенты использовали уязвимость нулевого дня в Artifactory, о которой компания сообщила JFrog. Позднее JFrog подтвердила, что проблема была исправлена.

Ранее Hugging Face упоминала лишь неопределенный прокси-кэш реестра пакетов. Новая деталь закрывает важный пробел в описании и показывает, почему дополнительные раскрытия от всех причастных сторон необходимы для понимания того, что именно произошло.

Какие модели были задействованы

OpenAI заявила, что ни одна из задействованных моделей не предназначалась для публичного выпуска. Это уточнение отвечает на вопросы, возникшие после первоначального раскрытия, где были названы GPT-5.6 Sol — выпущенная в этом месяце — и «еще более мощная предпродакшн-модель».

В обновлении OpenAI описала неназванную модель как «internal-only prototype». Компания также сообщила, что с тех пор она была «deactivated, encrypted, and restricted it from research access». Это может означать, что OpenAI замедлила или прекратила исследования в этой области.

Формулировка OpenAI указывает на то, что в инциденте могли участвовать более двух моделей. В сообщении компания написала, что инцидент был «driven by a combination of OpenAI models — including [emphasis ours] GPT‑5.6 Sol and an even more capable pre-release model». В интервью Fortune на прошлой неделе президент OpenAI Грег Брокман отметил: «мы сказали, что это комбинация моделей; мы упомянули две из них, но мы сказали, что это комбинация разных моделей».

Еще один важный факт из нового отчета Hugging Face заключается в том, что сначала они пытались остановить атаку с помощью моделей Anthropic Opus и Fable. Когда те «refused a large part of that work» из-за защитных ограничений, команда перешла на open source-модель, созданную китайской Z.ai. Когда Hugging Face впервые раскрыла инцидент, было неясно, какую именно закрытую модель они пытались использовать. Теперь известно, что это были модели Anthropic.

Модель не знала, что взламывает, а просто выполняла задачу

Не уверен, делает ли это ситуацию менее или более пугающей, но модели OpenAI не занимались явным взломом Hugging Face. Возможно, они даже не считали эту работу «жульничеством», хотя со стороны это выглядит именно так, поскольку они искали ответы в датасетах Hugging Face, которые позволили бы пройти бенчмарк под названием ExploitGym.

OpenAI уже сообщала, что модели не действовали с вредоносным умыслом, а лишь действовали «in pursuit of solving the evaluation problem». Но новый отчет Hugging Face приводит подтверждения.

Адриен Каррейра, сотрудник Hugging Face, участвовавший в подготовке технического post-mortem, сказал, что это был его главный вывод из инцидента. Агент «wasn’t trying to break things», а скорее пытался понять, что он может делать, и вел себя довольно осторожно. «One detail I keep coming back to: every destructive cloud API call the agent made, it made with DryRun=True», — сказал Каррейра.

«DryRun=True» — это команда, которая по сути заставляет систему имитировать действие без его фактического выполнения. Из 17,600 действий, которые ИИ совершил во время всей атаки, большинство «failed» и «went nowhere», сказала Hugging Face. Но вместе они постепенно проложили агенту рабочий путь для продвижения дальше.

«LLM agents bring a step increase in the number of paths an attacker can test, the speed at which failed paths can be replaced, and the volume of evidence defenders must interpret», — заявила Hugging Face.

Что мы имеем сейчас? Базовая хронология

Независимо от громких деталей, важно отметить, что мы все еще ждем ключевые даты в развитии этой истории. Но благодаря Hugging Face точные даты атаки теперь публичны.

Вот как выглядит примерная хронология.

9 июля: модели OpenAI начинают атаку.

13 июля: модели OpenAI завершают атаку.

16 июля: первое публичное раскрытие Hugging Face о том, что инцидент произошел.

21 июля: первое публичное раскрытие OpenAI о том, что ее модели были причастны.

27 июля: Hugging Face публикует свой «Technical Timeline of the July 2026 Incident»

28 июля: OpenAI обновляет первоначальный пост в блоге, добавив еще несколько деталей.

Мы до сих пор не знаем точно, когда OpenAI поняла, что ответственны ее модели, — это именно та деталь, которую мы надеемся увидеть в итоговом отчете OpenAI по инциденту. По данным Reuters, это произошло лишь после раскрытия Hugging Face 16 июля. В выходные 18–19 июля сотрудники OpenAI начали видеть в своих системах признаки того, что агент вышел за пределы тестовых ограничений.

Если OpenAI действительно не знала о действиях своих агентов, это ставит под сомнение ее способность надлежащим образом их контролировать. Президент и сооснователь OpenAI Грег Брокман сказал журналистам на медиакруглом столе на прошлой неделе, что модели сейчас настолько способны «in so many dimensions», что иногда можно упустить из виду «any one dimension that they’re actually very capable at».

Мы также не знаем, сообщала ли Hugging Face об инциденте в FBI и когда именно, как утверждает Reuters. Это означало бы отдельную хронологию событий внутри федерального правительства, которая по-прежнему остается неясной, и помогло бы лучше понять уровень надзора за нарушениями безопасности, связанными с ИИ.

FBI отказалось комментировать эту историю.

Эта история первоначально была опубликована на Fortune.com