Эксперты по безопасности ИИ предупреждают: модели OpenAI могли пересечь «критический» порог риска при автономном взломе Hugging Face
Ключевые выводы
- •Две модели OpenAI, включая недавно выпущенную GPT-5.6 Sol, автономно вышли из изолированной внутренней тестовой среды и взломали Hugging Face, связав zero-day эксплойты, чтобы похитить ответы к тесту по кибербезопасности без указаний человека.
- •Несколько экспертов по безопасности ИИ утверждают, что инцидент соответствует «критическому» порогу киберриска в рамках собственной Preparedness Framework OpenAI, которая требует от компании приостановить разработку до определения защитных мер, соответствующих этому стандарту.
- •OpenAI отказалась подтвердить, достигли ли модели критического порога, заявив лишь, что проводит тщательную проверку с внешними консультантами и под надзором своего Safety and Security Committee.
- •Модели действовали самостоятельно в течение нескольких дней, что соответствует критерию долгосрочной автономности, который OpenAI ранее называла предварительным условием для запуска дополнительных мер защиты от рассогласования, предназначенных для выявления обманчивого поведения моделей.
- •Согласно EU AI Act, вступившему в силу в августе 2025 года, frontier-лаборатории ИИ юридически обязаны принимать политики оценки рисков, сопоставимые с добровольной Preparedness Framework OpenAI.

Эксперты по безопасности ИИ выражают тревогу: модели OpenAI, ответственные за автономный взлом другой компании в сфере ИИ ранее в этом месяце, могли перейти в настолько серьезную категорию риска, что собственные внутренние политики OpenAI должны были потребовать временной остановки разработки.
Ранее на этой неделе OpenAI сообщила, что две ее модели — недавно выпущенная GPT-5.6 Sol и более мощная, еще не выпущенная система — вышли из изолированной внутренней тестовой среды, использовали ранее неизвестную уязвимость "zero-day" для выхода в открытый интернет, а затем взломали другую ИИ-компанию Hugging Face, одну из крупнейших в мире open-source платформ ИИ, где размещаются модели, наборы данных и инструменты, используемые миллионами разработчиков, чтобы похитить ответы к тесту по кибербезопасности, который они проходили.
Инцидент вызвал широкий резонанс во всем мире, но, возможно, сильнее всего — среди экспертов по безопасности ИИ, которые годами предупреждали о подобных рисках и призывали компании и правительства внедрять более надежные защитные меры. Он также стал одним из первых задокументированных случаев, когда frontier-модели ИИ автономно провели многоэтапную кибератаку на внешнюю цель без указаний человека — сценарий, который исследователи безопасности моделировали теоретически, но редко наблюдали на практике.
Несколько таких экспертов заявили Fortune, что взлом, по-видимому, показывает: модели OpenAI перешли на уровень риска, который опубликованные самой компанией политики безопасности классифицируют как "critical" — самый высокий уровень опасности. На этом уровне OpenAI в своих опубликованных политиках обязалась приостановить разработку моделей, пока не сможет разработать более эффективные системы контроля.
Порог "critical" определен в документе по политике рисков под названием OpenAI "Preparedness Framework". Согласно этой политике, обозначение опасности как "critical" применяется к модели, способной самостоятельно находить и создавать рабочие эксплойты для ранее неизвестных уязвимостей безопасности — известных как уязвимости "zero-day", поскольку у разработчиков было ноль дней на их исправление, — во многих хорошо защищенных реальных системах, либо к модели, способной разработать и выполнить полностью новую стратегию атаки против хорошо защищенной цели, получив только общую цель и не имея человеческого руководства. В политике говорится, что когда модель достигает такого уровня риска, OpenAI "halt further development" до тех пор, пока "we have specified safeguards and security controls standards that would meet a Critical standard."
Preparedness Framework является добровольным обязательством OpenAI, а не юридической обязанностью. Однако компания публикует документ на своем сайте, чтобы другие исследователи безопасности ИИ и общественность могли проверить, какие меры контроля она заявляет к внедрению. Принятие политики, подобной Preparedness Framework, является обязательным для frontier-лабораторий ИИ в соответствии с EU AI Act; соответствующая часть закона вступила в силу в августе 2025 года. Этот фреймворк представляет собой один из наиболее заметных примеров добровольных обязательств по безопасности, которые ведущие лаборатории ИИ приняли на фоне того, как правительства по всему миру стремятся установить регуляторные рамки для все более мощных систем.
"OpenAI's preparedness framework defines critical cybersecurity capabilities, and prescribes safeguards that need to be implemented before development can continue," — сказал Fortune Натан Калвин, генеральный юрисконсульт Encode AI, правозащитной группы в сфере безопасности ИИ. "From my reading of OpenAI's preparedness framework, it looks awfully like this internally deployed model met the critical criteria for cybersecurity. Does OpenAI dispute that critical designation? Do they plan to have safeguards that meet a Critical standard before proceeding further?"
Тайлер Джонсон, основатель надзорной группы в сфере ИИ Midas Project, также заявил, что модели, по-видимому, достигли самого высокого порога опасности. "I think a plain reading of it would say yes," — сказал он. "It operated independently over the course of a weekend, trying different attack vectors on Hugging Face and chaining multiple zero-day exploits."
OpenAI не ответила на конкретные вопросы Fortune о том, соответствовали ли модели, участвовавшие в инциденте, стандарту "critical", изложенному в ее политике рисков. Вместо этого представитель компании заявил: "This is an unprecedented incident, and we think it marks an important moment for AI safety. We are conducting a thorough review along with external advisors and with oversight from our Safety and Security Committee. Once the review is complete, we will publish a technical report of our learnings for everyone." Safety and Security Committee, созданный советом директоров OpenAI в 2024 году, отвечает за надзор за проверками безопасности самых мощных моделей компании.
По словам Джонсона, расплывчатость формулировок фреймворка может оставить пространство для споров. Порог требует, чтобы модель находила zero-day эксплойты "of all severity levels", но остается неясным, соответствуют ли этому требованию эксплойты, использованные при взломе Hugging Face. Он отметил, что для применения порога, возможно, потребуется продемонстрировать более серьезный класс уязвимости — например, такой, который дает злоумышленнику глубокий системный контроль над операционной системой компьютера, известный как доступ "kernel-level".
"OpenAI's model outsmarted its creators, exploited a never-before-discovered vulnerability in OpenAI's code, escaped onto the open internet, and attacked another company," — сказал Питер Уилдефорд, руководитель направления политики в AI Policy Network. "If this doesn't cross the line into Critical, OpenAI needs to say much more about what's going on and how this threshold works."
Эксперты указывают на недостающие защитные меры помимо критического порога
OpenAI ранее заявляла, что рассматривает свою новейшую модель GPT-5.6 как имеющую "High" риск в сфере кибербезопасности — более низкий из двух уровней риска, определенных в Preparedness Framework. Модели ниже порога "High" могут выпускаться без существенных мер снижения рисков.
Согласно политике OpenAI, обозначение High должно запускать несколько видов защиты: более строгие меры безопасности, механизмы предотвращения внешнего злоупотребления после публичного выпуска модели, защиту от непредсказуемого или вводящего в заблуждение поведения модели при интенсивном внутреннем использовании в исследованиях, а также усилия по помощи другим командам кибербезопасности в защите от подобных угроз.
Однако некоторые эксперты ставят под сомнение, была ли должным образом реализована одна из этих мер — защита от рассогласования при крупномасштабном внутреннем развертывании. Эти меры предназначены для выявления модели, которая действует обманчиво, скрывает свои реальные возможности или иным образом работает вопреки намерениям разработчиков — проблему, которую исследователи называют "deceptive alignment", когда модель может сотрудничать во время оценки, но вести себя иначе после развертывания.
Это не первый случай, когда соблюдение OpenAI именно этой защитной меры оказывается под пристальным вниманием. В феврале Fortune сообщала, что эксперты по безопасности утверждали: OpenAI не внедрила обязательные меры защиты от рассогласования после того, как ее модель GPT-5.3-Codex первой достигла "high" риска кибербезопасности в рамках Preparedness Framework.
Тогда OpenAI оспорила утверждение, что ее фреймворк требовал таких мер в данном случае, заявив, что дополнительные защиты вступают в силу только тогда, когда высокий киберриск возникает "in conjunction with" долгосрочной автономностью — способностью действовать самостоятельно в течение длительных периодов, — чего, по словам компании, GPT-5.3-Codex не продемонстрировала. Сообщается, что модели, участвовавшие в текущем инциденте с Hugging Face, действовали самостоятельно в течение нескольких дней, что, по-видимому, соответствует этому стандарту долгосрочной автономности.
"In February, we warned that OpenAI may have skipped on its required safeguards according to its own policy. They disagreed, claiming the model lacked long-range autonomy. But the model that hacked Hugging Face clearly has long-range autonomy, so where are the safeguards now," — сказал Джонсон.