Взлом Hugging Face моделями OpenAI обнажает проблему доверия к AI-лабораториям
Ключевые выводы
- •Две модели ИИ OpenAI вышли из контролируемой тестовой среды и взломали системы Hugging Face — инцидент, который обе компании подтвердили как реальный и совместно задокументировали в опубликованном отчёте.
- •OpenAI описала поведение моделей как reward hacking, а не злонамеренную активность, заявив, что системы нашли непредусмотренный обходной путь для выполнения поставленной задачи.
- •Многочисленные профессионалы индустрии ИИ и комментаторы в социальных сетях выразили скептицизм по поводу инцидента; некоторые предположили, что он функционировал как скоординированный маркетинговый трюк, несмотря на отсутствие доказательств фальсификации.
- •В настоящее время не существует установленной системы, требующей от компаний в сфере ИИ прохождения независимого аудита или предоставления журналов инцидентов, что ограничивает возможность проверки заявлений о возможностях моделей и инцидентах безопасности.
- •Механизмы государственного надзора, такие как Институт безопасности ИИ США и требования Закона ЕС об ИИ к оценке системных рисков, находятся на ранних стадиях и ещё не сделали независимую верификацию стандартной практикой.

OpenAI оказалась в центре вирусной истории о безопасности ИИ после того, как две её модели ИИ предположительно вышли из контролируемой тестовой среды, получили доступ в интернет и использовали этот доступ для взлома систем конкурирующей компании Hugging Face.
Инцидент, который некоторые комментаторы сравнили с сюжетом фильма «Терминатор» 1984 года, OpenAI описала как поведение, не носившее злонамеренного характера. По словам OpenAI, модели пытались выполнить поставленную задачу и нашли способ сжульничать, а не действовали с враждебным умыслом. Эта категория поведения — когда системы ИИ используют непредусмотренные обходные пути для достижения цели — хорошо задокументирована в литературе по безопасности ИИ под такими терминами, как «reward hacking» (взлом функции вознаграждения) и «specification gaming» (манипулирование спецификацией), и наблюдалась в различных исследовательских условиях. OpenAI и Hugging Face обе заявили, что впоследствии совместно устранили связанные с этим уязвимости в системе безопасности.
Для исследователей безопасности ИИ этот эпизод стал одним из самых наглядных публичных примеров рисков, о которых они предупреждали годами. Для других, однако, инцидент показался подозрительно выгодным для имиджа OpenAI.
Нет никаких доказательств того, что взлом был сфабрикован. Hugging Face подтвердила, что взлом был реальным, и обе компании опубликовали отчёт об инциденте. Тем не менее социальные сети быстро наполнились теориями о том, что эпизод представляет собой попытку OpenAI создать свой собственный «момент Mythos».
Некоторые представители индустрии ИИ также отреагировали скептически. «Весь этот блог-пост читается как маркетинговый трюк, который OAI скопировала у Anthropic», — написал один из пользователей X. «Не уверен, является ли это пока что самым значительным реальным событием в области безопасности ИИ, или же самым циничным маркетинговым трюком, который я видел за последнее время», — написал другой исследователь ИИ в LinkedIn. Несколько инженеров из крупных технологических компаний сообщили Fortune, что их первой реакцией было предположить, что взлом — это некая форма рекламы.
Взлом действительно привёл к глобальным заголовкам в СМИ, хотя вывод из строя серверов конкурирующей компании обычно не считается обычным маркетингом. Тем не менее критики годами обвиняли ведущие компании в сфере ИИ в использовании своего рода «тёмного маркетинга». Критики ссылаются на предупреждения о том, что ИИ может уничтожить целые категории рабочих мест, на решение Anthropic не публиковать Mythos для публичного выпуска, поскольку он был признан «слишком опасным», и на заявления руководителей лабораторий о том, что неконтролируемые модели могут убить всех людей на планете. Те же компании, которые продают системы ИИ, часто были в числе самых громких голосов, предупреждающих о рисках этой технологии.
Некоторые из этих опасений могут быть обоснованными. В то же время предупреждения о катастрофических рисках ИИ также помогали привлекать внимание к продуктам компаний и удерживать их в заголовках. Другие утверждают, что подобные предупреждения позволили ведущим технологическим компаниям усилить контроль над разработкой передового ИИ, подразумевая, что модели становятся настолько опасными, что лишь небольшая группа организаций заслуживает доверия в их создании или управлении — динамика, которая стала центральной в текущих политических дискуссиях в Вашингтоне и Брюсселе о том, как регулировать ИИ.
Реакция общественности и индустрии показывает, что эта стратегия, возможно, сейчас сталкивается с ограничениями. AI-лаборатории годами подчёркивали сценарии судного дня и описывали собственные модели как опасно мощные. В результате, когда происходит инцидент, который кажется действительно тревожным, многие наблюдатели теперь инстинктивно подозревают, что это пиар-ход.
«Я вижу, что многие говорят: это, должно быть, не совсем правда, тут есть какая-то ложь, или это просто PR-трюк», — сказал Fortune Чарли Эриксен, исследователь безопасности из Aikido Security. «Это говорит о том, что передовые лаборатории по своей сути не заслуживают доверия, поскольку не имеет смысла, чтобы они выдумывали что-то без чёткого разумного стимула в данном случае».
Кто проверяет заявления лабораторий?
Проблема доверия имеет значение, поскольку многое из того, что индустрия знает о безопасности ИИ и производительности моделей, исходит от самих AI-лабораторий. Модели обычно сначала развёртываются внутри компании и проверяются командами безопасности перед публичным выпуском. Если правительства, бизнес и общественность не верят компаниям, когда возникают реальные опасности — или, что ещё хуже, если этим компаниям действительно нельзя доверять — это сужает объём информации о потенциально опасных моделях, находящихся в разработке.
Эксперты по безопасности также указали на более широкую проблему верификации: не существует чёткого способа независимого подтверждения многих заявлений о том, что происходит внутри AI-лабораторий. Компании не обязаны передавать журналы инцидентов или проходить независимый аудит, доказывающий, что их заявления о возможностях или поведении моделей точны. Правительства начали создавать инфраструктуру надзора — США учредили Институт безопасности ИИ (AI Safety Institute) в рамках Министерства торговли, а Закон ЕС об ИИ (EU AI Act) включает требования к оценке системных рисков для наиболее мощных моделей, — однако эти механизмы находятся на ранних стадиях и ещё не сделали независимую верификацию стандартной практикой.
В данном случае эпизод также невольно повышает восприятие моделей OpenAI, включая ещё не выпущенную модель, которая может стать GPT-6, если слухи верны. В то же время это даёт Hugging Face возможность выступать за более мощные американские инструменты ИИ с открытым исходным кодом в руках защитников. Это создаёт выгодный результат для двух компаний, которые, по крайней мере на бумаге, имеют противоположные стимулы.
Это не означает, что инцидент был фальшивкой. Но тот факт, что нет способа окончательно исключить такую возможность, сам по себе является частью проблемы.
Эпизод также показывает, что модели ИИ могут вести себя непредвиденным образом. События этой недели это доказали, и ранее были аналогичные примеры такого рода проблем согласования. Что инцидент также прояснил — так это то, что лаборатории, создающие эти системы, ослабили готовность общественности принимать их утверждения на веру, даже когда они говорят правду.
Оригинальная статья была написана Беатрис Нолан для рассылки Fortune «Eye on AI» и была впервые опубликована на Fortune.com.