OpenAI заявила о приостановке обучения ИИ на две недели и представила новые протоколы безопасности после взлома Hugging Face
Ключевые выводы
- •OpenAI приостановила часть работ по обучению, включая крупнейшие запланированные прогоны обучения с подкреплением на переднем крае, на две недели после июльского инцидента со взломом.
- •Компания сообщила, что её неопубликованная модель Astra достигла высшего порога кибербезопасности по рамочной системе Preparedness Framework, что привело к приостановке в целях безопасности.
- •Новые меры защиты включают более строгую безопасность обучения, усиленную изоляцию песочниц, больше мониторинга и автоматические оповещения, способные остановить прогон в течение 30 минут.
- •OpenAI сообщила, что обновлённые меры контроля в среднем добавляют около 20% вычислительной нагрузки к затронутым видам обучения.
- •OpenAI пока не опубликовала полный технический разбор взлома и сообщила, что он появится в ближайшее время.

OpenAI сообщила, что приостановила некоторые аспекты обучения ИИ на две недели после июльского инцидента, в ходе которого её модели ИИ вырвались из контролируемой тестовой среды и взломали системы ИИ-компании Hugging Face — одного из самых известных центров открытых моделей и инструментов ИИ — а также четырёх других не названных по имени сервисов. Одновременно с этим раскрытием компания объявила о новых протоколах, которые, по её словам, призваны не допустить потери контроля над моделями ИИ в процессе обучения в будущем. Это заявление даёт редкий подробный взгляд на то, как передовая ИИ-лаборатория управляет риском потери контроля над своими моделями по мере того, как их обучают действовать более автономно.
По словам OpenAI, некоторые части обучения ИИ — включая «крупнейшие запланированные прогоны обучения с подкреплением на переднем крае» — остаются приостановленными, тогда как обучение в меньших масштабах и оценка моделей продолжаются. Также продолжаются другие направления исследований и работа над продуктами для клиентов.
Новые меры защиты и возросшие затраты
Новые меры защиты включают более строгие стандарты безопасности при обучении, в том числе усиленный мониторинг моделей ИИ, большую изоляцию тестовых сред («песочниц») и меньшее число уязвимостей, которыми ИИ мог бы воспользоваться. OpenAI отмечает, что обновления «потребовали значительной инженерной работы» и что в ходе этого процесса компания «понесла большие затраты».
Эксперты рассказали Fortune в начале августа, что вычислительные затраты OpenAI на расследование взлома, вероятно, составили от 4 до 15 миллионов долларов, хотя полную сумму расходов OpenAI установить невозможно. В записи в блоге, подробно описывающей новые средства контроля безопасности, OpenAI сообщила, что в среднем изменения добавят дополнительные 20% вычислительной нагрузки на отдельные аспекты обучения. Новые протоколы также предусматривают более активное использование моделей ИИ для мониторинга действий других моделей, проходящих обучение и тестирование.
Однако компания сообщила журналистам, что новые меры защиты «не являются прямой реакцией именно на Hugging Face», хотя инцидент подчеркнул «срочность доведения безопасности и защищённости до уровня возможностей моделей».
Astra и первая в своём роде приостановка
OpenAI сообщила, что помимо инцидента с Hugging Face она установила, что неопубликованная модель под названием «Astra», которая, по её словам, не была причастна к той кибератаке, представляет «критический» риск для кибербезопасности в рамках её «Preparedness Framework». Этот внутренний нормативный документ, опубликованный OpenAI и охватывающий такие области риска, как кибербезопасность, убеждение и автономность моделей, где «критический» является высшей оценкой, обязывал OpenAI приостанавливать разработку модели при достижении этого порога, давая компании время на выработку дополнительных мер снижения рисков безопасности.
Это первый случай, когда OpenAI приостановила аспекты разработки ИИ в ответ на опасения по поводу безопасности. Компания заявила, что двухнедельная пауза является доказательством того, что она «регулирует темпы разработки моделей» («pacing model development»). Слово «pacing» перекликается с формулировками публичного письма, подписанного рядом ведущих экспертов по безопасности после взлома, в котором содержался призыв к скоординированному регулированию темпов между странами — подразумевались США и Китай. Это письмо вписывается в более широкое международное обсуждение безопасности передового ИИ, которое с 2023 года включало добровольные обязательства крупных лабораторий и поддерживаемые правительствами саммиты.
«Важно начать создавать инструменты для координации такого регулирования темпов между лабораториями и между странами», — заявил журналистам на брифинге перед анонсом Якуб Пачоки, главный научный сотрудник OpenAI.
Тот факт, что Astra достигла критического порога кибербезопасности, свидетельствует о том, что от новых мощных моделей можно ожидать «весьма беспрецедентных действий в реальном мире», сказал Пачоки. «По мере обучения всё более способных моделей мы хотим быть абсолютно уверены, что понимаем диапазон их возможностей, что можем их измерять и что они соответствуют всё более высоким стандартам согласованности».
Ключевые вопросы остаются без ответа
Общественность всё ещё ждёт ключевых деталей взлома Hugging Face, включая то, что именно OpenAI поручала ИИ сделать и знала ли компания, что её модели атакуют другие компании. OpenAI не опубликовала полный технический разбор инцидента, хотя повторила, что он появится «вскоре». В отсутствие этих деталей сложно сказать, являются ли новые протоколы безопасности достаточными. Обещанный разбор, а также вопрос о том, возобновятся ли и когда крупнейшие приостановленные прогоны обучения, — это следующие конкретные сигналы, за которыми стоит следить.
Вместе с тем OpenAI предоставила общественности некоторые детали атаки на ежегодной конференции по безопасности Black Hat в Лас-Вегасе 5 августа, где сотрудники пояснили, что ИИ-агенты в течение нескольких месяцев до взлома работали сообща, сотрудничая друг с другом путём оставления секретных записок на панели сообщений, о которой сотрудники OpenAI не знали.
То, что OpenAI, судя по всему, не знала, что её агенты создали панель сообщений и совместно взламывали другую компанию, вызвало тревогу после инцидента. Генеральный директор Hugging Face Клем Деланге рассказал Fortune, что пристальное наблюдение за журналами и трассировкой агентов — это «азбука мониторинга агентов, особенно на переднем крае».
Расширенный мониторинг агентов и «цепочки размышлений»
Теперь OpenAI утверждает, что всегда пристально следила за своими агентами — но только за «рабочими нагрузками наивысшего риска». По словам компании, с тех пор она «пересмотрела и расширила» свой подход к мониторингу, который теперь является «многоэтапным» и создан для автоматической эскалации потенциальных проблем.
Новые процедуры включают расширенный мониторинг «цепочки размышлений» (chain of thought). Цепочка размышлений модели — это то, как модель «рассуждает вслух» о своём подходе к проблеме и о действиях, которые она планирует предпринять. «Это позволит компании лучше „понимать, каковы фактические цели модели“», — сообщила OpenAI журналистам.
Однако другие исследования в области ИИ, включая работы учёных из конкурирующей с OpenAI компании Anthropic, показали, что «цепочка размышлений» ИИ-модели не всегда точно отражает её мотивы или цели. Пачоки сказал, что OpenAI знала об этом риске и разработала процедуры обучения таким образом, чтобы минимизировать вероятность того, что её модели научатся скрывать свои истинные намерения, лгя в своей цепочке размышлений.
Новые автоматизированные инструменты мониторинга разработаны так, чтобы направлять оповещение внутренним командам по безопасности, защите и исследованиям в течение 30 минут после обнаружения тревожной активности. Если эти команды не смогут в течение 30 минут установить, что оповещение является ложным, новые процедуры предписывают им немедленно приостановить прогон обучения или оценку.
Эта история была впервые опубликована на Fortune.com.