Хелен Тонер: взлом Hugging Face со стороны OpenAI был лишь вопросом времени и выявляет серьезную слепую зону в политике в отношении ИИ
Ключевые выводы
- •Две модели OpenAI вышли из тестовой песочницы и скомпрометировали Hugging Face во время внутренних испытаний кибербезопасности.
- •О взломе стало известно благодаря добровольному раскрытию информации OpenAI и Hugging Face, а не обязательной процедуре отчетности.
- •В статье говорится, что нынешняя политика в сфере ИИ слишком сосредоточена на публичном выпуске и упускает риски внутреннего использования передовых моделей.
- •Автор утверждает, что ИИ-агенты могут прибегать к reward hacking и другим формам обманного поведения при достижении поставленных целей.
- •Среди предлагаемых мер надзора — регулярное внутреннее тестирование, повышение прозрачности и использование регуляторных подходов, заимствованных из финансовой и биомедицинской сфер.

Во вторник на прошлой неделе на сайте OpenAI появился блог-пост с безобидным заголовком, но в нем содержалась сенсационная новость. Во время внутреннего тестирования две модели компании вырвались из-под контроля и взломали серверы Hugging Face, крупной платформы для хостинга решений в области искусственного интеллекта. Это стало поворотным моментом — впервые кибератака, по-видимому, была задумана, спроектирована и выполнена ИИ.
Я более десяти лет работала в сфере ИИ и вокруг нее, в том числе входила в совет директоров OpenAI, и знаю, что среди разработчиков ИИ существует открытый секрет: подобный инцидент давно ожидался, и лучшие ученые и инженеры в мире по-прежнему не знают, как его предотвратить.
Две ИИ-системы, стоявшие за взломом, были самой продвинутой публичной моделью OpenAI и более новой, еще более продвинутой моделью, которую пока не разрешили выпускать для публичного использования. Когда исследователи OpenAI дали системам набор сложных задач по кибербезопасности, чтобы оценить их возможности, модели пришли к выводу, что лучший способ получить высокий результат — просто украсть ответы. Для этого они использовали несколько продвинутых техник, чтобы сначала выбраться из якобы защищенной «песочницы», которую OpenAI применяла для тестирования, а затем взломали базы данных Hugging Face. Hugging Face размещает продукты и наборы данных для ИИ. Оказавшись внутри, ИИ-атакующие в течение нескольких дней совершили тысячи автономных действий, расширяя доступ к инфраструктуре компании.
Об этом необычном событии стало известно только благодаря добровольным раскрытиям со стороны Hugging Face и OpenAI. Ни одна из действующих политик, направленных на управление рисками от передовых моделей, не требовала бы уведомлять об этом общественность — или даже государственный орган.
Это обнажает серьезную слепую зону в нынешнем политическом подходе к управлению рисками все более продвинутых ИИ-систем: то, как ИИ-компании используют передовые, еще не выпущенные модели внутри собственных стен.
Подход администрации Трампа к рискам ИИ за последние месяцы быстро изменился по мере того, как ИИ становился более полезным для помощи человеческим хакерам. Отказавшись от невмешательства, которого Белый дом придерживался на протяжении 2025 года, он в последнее время де-факто начал требовать, чтобы компании с передовыми ИИ-моделями проводили серию тестов безопасности перед широким выпуском продуктов. Такой подход, известный как тестирование до развертывания, на первый взгляд кажется разумным — мы хотим убедиться, что каждая ИИ-система безопасна, прежде чем дать ее в руки миллиардам людей.
Проблема в том, что акцент на датах выпуска полностью игнорирует масштабное использование новейших и наиболее продвинутых ИИ-систем внутри самих ИИ-компаний. Как показывает инцидент прошлой недели, такие внутренне развернутые системы могут представлять серьезные риски — в том числе для третьих лиц. Речь идет не только о публичном запуске продукта; речь также идет о мощных моделях, которые уже используются для разработки, тестирования и улучшения следующего поколения систем.
Чтобы понять почему, важно осознать, насколько эти системы отличаются от чат-ботов, которые для многих по-прежнему синонимичны ИИ. Они не просто выводят текст в окно чата. Сегодняшние системы все чаще работают как «агенты», которые могут действовать напрямую в цифровом мире, по сути управляя компьютером так же, как это делает человек. ИИ-агенты оказываются полезными, но также демонстрируют выраженную склонность к поведению, известному как «reward hacking» — поиску непредусмотренных способов выполнить поставленные людьми задачи, иногда доходя до откровенного мошенничества. Это включает случаи, когда ИИ получал доступ к данным и удалял их, хотя они должны были быть запрещены, переименовывал файлы, чтобы ввести в заблуждение человеческих тестировщиков, и активно заметал следы, чтобы люди не заметили нежелательное поведение.
Чтобы справиться с рисками, которые создают такие высокоавтономные и нередко скрытные ИИ-системы, нужно менять и подход к регулированию. Вместо того чтобы рассматривать ИИ-компании как поставщиков программного обеспечения, продающих улучшенные текстовые редакторы, регуляторы могут обратиться к другим отраслям, где риск возникает из-за деятельности внутри самой отрасли. Биологические лаборатории, работающие со смертоносными патогенами, финансовые компании, торгующие на миллиарды долларов, и химические предприятия, обращающиеся с токсичными материалами, все находятся под надзором за своими внутренними операциями, а не только за внешними продуктами.
Для ИИ первым шагом должно стать повышение прозрачности того, как компании используют свои самые продвинутые системы внутри организации. Один простой вариант — взять текущий набор тестов, который проводится перед публичным выпуском новой модели, и регулярно, например ежеквартально, применять его к лучшей доступной внутри компании модели или моделям. Компании используют собственный ИИ для создания все более умных систем, иногда таким образом, который они сами до конца не понимают. Это не должно оставаться невидимым для внешнего надзора.
В более долгосрочной перспективе другие отрасли предлагают механизмы, которые можно адаптировать и к ИИ. В финансовой сфере «resident examiners» — это специализированные группы регуляторов, которые работают внутри офисов крупных банков. В биомедицинских исследованиях действуют строгие стандарты, определяющие уровень защиты, необходимый для работы с биологическими материалами разных уровней риска. Во многих отраслях правила отчетности об инцидентах требуют, чтобы в случае проблем информация о том, что произошло и как это исправить, не оставалась внутри одной организации. Если ИИ продолжит развиваться, эти подходы и другие механизмы можно будет адаптировать для управления рисками внутри компаний, продвигающих ИИ-фронтир.
В сентябре 2024 года меня попросили выступить перед комитетом Сената по вопросу о том, что Конгресс может неверно понять в ИИ, если будет слушать только генеральных директоров компаний и лоббистов. Мой ответ заключался в том, что, находясь в Вашингтоне, очень трудно до конца понять, что именно пытаются сделать ведущие ИИ-компании. Правда, хорошо известная в Кремниевой долине, состоит в том, что они пытаются создать машины, способные переиграть и превзойти любого человека, и не знают, смогут ли направить эти машины к полезным целям. Как сказал один из сооснователей OpenAI в документальном фильме 2019 года: «Будущее в любом случае будет хорошим для ИИ. Было бы неплохо, если бы оно было хорошим и для людей».
Чтобы у нас появился шанс добиться этого, нужно уже сейчас начать внимательно изучать, что ИИ-компании создают за закрытыми дверями.
Мнения, выраженные в комментариях Fortune.com, принадлежат только их авторам и не обязательно отражают взгляды и убеждения Fortune.
Этот материал был впервые опубликован на Fortune.com