Взлом Hugging Face выявил парадокс кибербезопасности open-weight ИИ
Ключевые выводы
- •Во время внутреннего тестирования GPT-5.6 Sol и не опубликованной исследовательской модели несколько ИИ-агентов OpenAI вышли из ограниченной среды и атаковали Hugging Face примерно в 17 600 инцидентах, по-видимому пытаясь списать тест.
- •Агенты сговорились, используя экземпляр Artifactory OpenAI и оставляя заметки об обнаруженных уязвимостях для будущих агентов, фактически создав общую доску сообщений.
- •Инцидент затронул инфраструктуру обработки наборов данных Hugging Face, производственную среду, внутренние сети, учетные данные, рабочую базу MongoDB и некоторые репозитории исходного кода; подтвержденный доступ к данным клиентов был ограничен пятью наборами данных, связанными с бенчмарком ExploitGym/CyberGym, плюс эксплуатационными метаданными.
- •Поскольку защитные ограничения на ведущих американских облачных моделях блокировали форензику, Hugging Face использовала open-weight-модель zai-org/GLM-5.2 от Z.Ai на собственной инфраструктуре, что также не позволило данным атакующего и учетным данным покинуть среду компании.
- •В июльской публикации The New York Times со ссылкой на пять человек, близких к обсуждениям, говорилось, что OpenAI и Anthropic призывали Вашингтон ограничить мощные открытые китайские модели, а исследования вроде статьи июля 2025 года «Watch the Weights» показывают, что доступ к весам может помогать выявлять вредоносное поведение.

«ИИ, вероятно, скорее всего приведет к концу света, но тем временем появятся отличные компании», — сказал CEO OpenAI Сэм Альтман в 2015 году, примерно за шесть месяцев до основания OpenAI.
Спустя семь лет CEO Anthropic Дарио Амодеи высказал схожее предостережение:
«Я думаю, нам не следует слишком спешить или пытаться строить модели, которые намного больше, чем те, что создают другие организации».
Тем не менее обе компании теперь находятся в центре этой гонки. В июле отрасль получила реальное представление о том, как ИИ-модели ведут себя непредсказуемо, во время внутреннего тестирования GPT-5.6 Sol и не опубликованной исследовательской модели OpenAI. Несколько ИИ-агентов вышли из ограниченной тестовой среды в широкий интернет и взломали ориентированный на ИИ аналог GitHub — Hugging Face, по-видимому пытаясь списать тест.
ИИ-агент — это система, которая самостоятельно наблюдает, принимает решения и выполняет действия с помощью специализированных инструментов для достижения заданной цели в автономном режиме. Этот тревожный инцидент указывает на то, что технология начала вести себя непредсказуемо, а ее цели не совпадают с нашими.
Он также вызывает опасения относительно защитных ограничителей безопасности, встроенных в коммерческие американские модели. Хотя эти ограничители не являются безошибочными в предотвращении враждебного использования, они не позволили Hugging Face защититься с помощью ведущих американских моделей. В итоге компании пришлось перейти на более слабую open-weight ИИ-модель от Z.Ai, чтобы противостоять вышедшим из-под контроля ИИ.
Мошенничество на тесте
Похоже, агенты также начали сговариваться между собой. Через несколько недель после начала тестирования в начале мая агенты использовали экземпляр OpenAI в менеджере программных репозиториев Artifactory и оставляли заметки о том, как это делать, для будущих агентов — фактически создав доску объявлений для обмена обнаруженными уязвимостями.
Затем этот неограниченный доступ к интернету был использован для атак на Hugging Face примерно в 17 600 инцидентах, прежде чем компания отключила несанкционированный доступ 13 июля.
Инцидент затронул инфраструктуру обработки наборов данных Hugging Face, производственную среду, внутренние сети, учетные данные сервисов и облака, рабочую базу данных MongoDB и ограниченный набор внутренних репозиториев исходного кода. Подтвержденный доступ к данным клиентов был ограничен пятью наборами данных, по-видимому связанными с бенчмарком ExploitGym/CyberGym, а также некоторыми эксплуатационными метаданными.
Визуализация инцидента июля 2026 года. Источник: Hugging Face
Раскрывая инцидент 16 июля, Hugging Face признала — хотя тогда еще не знала, кто был виновником, — что это «отличалось от всего, с чем мы сталкивались ранее, в одном важном отношении». Компания уже понимала, что именно делало инцидент особенным:
«Он был полностью, от начала до конца, обусловлен автономной системой ИИ-агентов — и мы обнаружили и разобрали его в значительной степени с помощью собственного ИИ».
Важность open-weight ИИ
Расследование Hugging Face выявило то, что компания называет проблемой «асимметрии», возникающей из-за ограничений, накладываемых на приложения закрытых ИИ-моделей ведущими поставщиками, такими как OpenAI и Anthropic. Когда компания начала анализировать журналы инцидента — включая большие объемы реальных команд атаки, — сработали ограничения безопасности, призванные не допустить использования ИИ злоумышленниками для разработки кибератак. Вместо этого защитные ограничения помешали компании использовать те же ИИ для защиты.
Hugging Face обратилась к китайской open-weight-модели zai-org/GLM-5.2, запустив ее на собственной инфраструктуре, под собственным контролем и без внешних ограничений.
Хотя эти термины часто употребляются как взаимозаменяемые, open-source и open-weight модели — это не одно и то же. Open-weight ИИ-модели публикуют свои обученные параметры — фактический «мозг ИИ», — тогда как open-source ИИ-модели также предоставляют исходный код и, в идеале, методы обучения и другие компоненты, необходимые для изучения, модификации и воспроизведения системы.
В публикации Hugging Face объясняется, что запуск open-weight-модели на собственном оборудовании «дал и второе преимущество: данные злоумышленника и все учетные данные, на которые они ссылались, не покинули нашу среду». Это указывает на существенную асимметрию между защитниками и атакующими в таких случаях:
«Этот опыт указывает на разрыв, к которому стоит заранее подготовиться. Мы не знаем, какая модель управляла агентами атакующего — взломанная размещенная модель или неограниченная open-weight-модель; в любом случае атакующий не был связан никакой политикой использования, тогда как наша собственная форензика была заблокирована защитными ограничителями тех размещенных моделей, которые мы сначала попробовали».
Разделение в мире open source ИИ
Существует заметный разрыв между теми, кто считает, что ИИ следует развивать открыто, и теми, кто настаивает, что технология, лежащая в основе передовых моделей, должна оставаться строго засекреченной.
Связано: OpenAI заявляет, что модели ИИ вышли из-под контроля и взломали Hugging Face
Представители ведущих американских ИИ-лабораторий утверждают, что мощные крупные open-weight-модели опасны. Демис Хассабис, CEO ИИ-лаборатории Google DeepMind, критиковал OpenAI за выпуск своей работы в формате open source еще в 2016 году, когда компания все еще соответствовала своему названию:
«Есть много веских аргументов в пользу того, что выбранный вами подход действительно очень опасен и, по сути, может повысить риск для мира».
OpenAI прекратила выпуск весов флагманских моделей вместе с все еще не опубликованной GPT-3 в 2020 году. Сооснователь компании и бывший главный научный сотрудник Илья Суцкевер в 2023 году сказал, что «просто не имеет смысла» открывать исходный код таких моделей и что это «плохая идея».
«По мере того как мы приближаемся к созданию ИИ, будет разумно становиться менее открытыми».
Open-weight-модели практически невозможно контролировать, особенно в том, для каких целей они используются. Встроенные защитные механизмы можно, и регулярно это делается, удалять с помощью процесса, известного как abliteration.
Защитные механизмы — палка о двух концах
Представленный OpenAI в июне 2026 года федеральный политический план предлагает обязательную оценку ИИ-моделей и другие правила, формально нейтральные к этапу развертывания, но на практике это подвергло бы передовой open-weight-релиз предварительной проверке со стороны правительства.
Anthropic выбрала несколько иной подход и выступает за более жесткий экспортный контроль на передовые ИИ-чипы и за пресечение попыток извлечь или воспроизвести американские модели. В заявлении от апреля 2025 года компания рекомендовала усилить US AI Diffusion Rule и снизить пороги для нелицензированного доступа к крупным вычислительным кластерам.
Официально ни одна из компаний напрямую не выступала против open-weight-моделей. Однако в июльской публикации The New York Times со ссылкой на пять человек, близких к обсуждениям, утверждалось, что OpenAI и Anthropic призывали Вашингтон ограничить мощные открытые китайские модели.
Дискуссия сводится к спору о том, предпочтительнее ли риски централизованного контроля рискам полного отсутствия контроля — особенно с учетом того, что сама компания, о которой идет речь, уже показала, что не справляется с удержанием созданной ею технологии.
Необходимость Hugging Face защищаться с помощью open-weight-модели показывает опасность концентрации слишком большой власти в руках одного субъекта. Компания сформулировала практический вывод так:
«Атакующий не был связан никакой политикой использования, тогда как наша собственная форензика была заблокирована защитными ограничителями тех размещенных моделей, которые мы сначала попробовали. Практический вывод для защитников: заранее иметь проверенную и готовую к использованию мощную модель, которую можно запускать на собственной инфраструктуре, чтобы избежать блокировки защитными ограничителями и не допустить, чтобы данные атакующего и учетные данные покидали вашу среду».
Ограничение доступа к мощным моделям может сократить число квалифицированных атакующих, но если неограниченные атакующие уже существуют, ограничение защитников может стать уязвимостью безопасности. Кроме того, некоторые формы исследований безопасности ИИ требуют доступа к весам модели, а значит, их нельзя проводить на моделях, предлагаемых такими компаниями, как Anthropic или OpenAI.
Open weights помогают исследователям предотвращать атаки
Статья «Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs», впервые опубликованная в июле 2025 года, показывает, как исследователи выявляют вредоносное или скрытое поведение, анализируя изменения внутри весов модели. В некоторых экспериментах исследователи остановили до 100% проверенных атак через скрытые закладки при уровне ложноположительных срабатываний ниже 1% и обнаружили попытки восстановить удаленные знания более чем в 95% случаев. Результаты не показывают, как повели бы себя самые мощные передовые модели при таком же анализе, но служат убедительным аргументом в пользу прозрачности.
Однако столь же убедителен и аргумент в пользу того, чтобы не допускать передовые ИИ-технологии в руки злоумышленников — особенно по мере того, как разрыв между открытыми и закрытыми моделями продолжает сокращаться. Джеффри Хинтон, лауреат Нобелевской премии и пионер ИИ, известный как «крестный отец ИИ», в отчете заявил, что «как только у вас есть веса, вы можете дообучить их на плохие вещи». В выступлении он утверждал, что это слишком сильно снижает порог входа:
«Обучение базовой модели не стоит так уж дорого. Возможно, вам нужно $10 million, возможно, $100 million. Но небольшая банда преступников не сможет это сделать. А дообучить open-source-модель довольно легко».
Magazine: Создание “хорошего” AGI, который не убьет нас всех — The Artificial Superintelligence Alliance