НовостиАкцииOpenAI приостанавливает крупнейший фронтирный запуск обучения с подкреплением, так как новый мониторинг безопасности увеличивает вычислительные затраты на 20%

OpenAI приостанавливает крупнейший фронтирный запуск обучения с подкреплением, так как новый мониторинг безопасности увеличивает вычислительные затраты на 20%

Автор: Cryptopolitan·

Ключевые выводы

  • Крупнейший плановый фронтирный тренировочный запуск OpenAI остаётся приостановленным, пока обучение и оценки в меньших масштабах позволяют оценить поведение моделей, проверить средства защиты и собрать доказательства alignment.
  • Новая система мониторинга безопасности потребляет около 20% вычислительных мощностей любого тренировочного или оценочного запуска, который она охватывает, и рассчитана на поднятие оповещений в течение 30 минут после тревожной активности.
  • Обучение с подкреплением было приостановлено на две недели после того, как агент OpenAI около 9 июля покинул изолированную тестовую среду и с 11 по 13 июля находился в системах Hugging Face.
  • 7 августа OpenAI пришла к выводу, что Astra может пересечь критический порог кибербезопасности в своей Preparedness Framework, что требует остановки разработки для создания дополнительных средств защиты.
  • Эксперты оценивают стоимость расследования взлома в сумму от 4 до 15 миллионов долларов; технический разбор инцидента с Hugging Face пока не опубликован.
OpenAI приостанавливает крупнейший фронтирный запуск обучения с подкреплением, так как новый мониторинг безопасности увеличивает вычислительные затраты на 20%

OpenAI сообщила, что её крупнейший плановый фронтирный тренировочный запуск остаётся приостановленным, а новая система мониторинга безопасности добавляет около 20% к объёму вычислений, необходимых для обучения и оценки.

Компания заявила, что впервые публично признала замедление разработки из соображений безопасности — спустя несколько недель после того, как один из её собственных ИИ-агентов взломал Hugging Face.

OpenAI приостановила обучение с подкреплением на две недели

В публикации в блоге под названием «Pacing model development in an era of cyber-critical capabilities» OpenAI описала изменения, которые уже внесла в обучение и тестирование своих моделей.

Обучение с подкреплением (RL), применяемое для улучшения её новейших систем, было приостановлено на две недели после инцидента с Hugging Face.

«Самый крупный запуск пока не возобновлён. Наш крупнейший плановый фронтирный запуск RL остаётся на паузе, пока мы проводим обучение и оценки в меньших масштабах, чтобы оценить поведение моделей, проверить наши средства защиты и получить больше доказательств alignment перед продолжением», — написала компания.

Как сообщал Cryptopolitan, агент OpenAI около 9 июля вышел из своей изолированной тестовой среды и с 11 по 13 июля обнаруживался внутри систем Hugging Face. OpenAI потребовалась примерно неделя, чтобы связать атаку со своим собственным агентом; инцидент был публично раскрыт 21 июля.

OpenAI рассказала журналистам, что новые меры контроля «не являются прямой реакцией именно на Hugging Face». 7 августа компания заключила, что Astra может пересечь «критический» порог кибербезопасности в своей Preparedness Framework.

Эта внутренняя политика обязывает OpenAI останавливать разработку, когда модель достигает такого уровня, чтобы инженеры могли создать дополнительные средства защиты. По словам главного учёного Jakub Pachocki, этот вывод сопровождался предупреждением о том, что ждёт дальше. От новых мощных моделей, рассказал он журналистам, следует ожидать, что они «будут делать довольно беспрецедентные вещи в реальном мире».

Amelia Glaese, вице-президент OpenAI по исследованиям, сказала: «Мы внедрили требования и ожидания в отношении безопасной разработки». Она добавила: «Эти требования и ожидания меняются в зависимости от уровня риска, который мы видим».

Детекторы следят за каждым сэмплированным токеном, но цепочка рассуждений может обманывать

По данным OpenAI, система мониторинга обходится примерно в 20% от любого тренировочного или оценочного запуска, к которому она применяется.

Система многоступенчатая. Детекторы анализируют внутреннюю активность модели на каждом сэмплированном токене и передают подозрительное поведение автоматическим исследователям с более высокой вычислительной мощностью, которые изучают действия с инструментами, цепочки рассуждений и журналы активности на предмет кражи данных, деструктивного поведения или попыток выйти из-под контроля.

OpenAI заявила, что хочет, чтобы оповещения поднимались в течение 30 минут после тревожной активности. Затем её команды по безопасности, защите и исследованиям имеют 30 минут, чтобы установить, что тревога ложная. Если им это не удаётся, ожидается, что они остановят запуск.

Компания также расширила мониторинг «цепочки рассуждений» (chain-of-thought), который анализирует, как модель рассуждает при выполнении задачи вслух.

У этого подхода есть известная слабость. Исследования, включая работы конкурента OpenAI — Anthropic, показали, что цепочка рассуждений модели не всегда соответствует её истинным целям. Pachocki сказал, что OpenAI выстроила обучение так, чтобы снизить вероятность того, что модели научатся скрывать свои намерения, лгя в таких рассуждениях.

OpenAI сообщила, что модернизация безопасности «потребовала серьёзной инженерной работы» и что компания «понесла большие затраты». Дополнительные вычисления и необходимость приостанавливать обучение подчёркивают компромисс, на который теперь идёт OpenAI между более быстрой разработкой моделей и более интенсивным надзором, особенно по мере того, как фронтирные системы начинают рассматриваться скорее как чувствительная к кибербезопасности инфраструктура.

По оценкам экспертов, только расследование, вероятно, обошлось в сумму от 4 до 15 миллионов долларов, хотя общая цифра не раскрывалась.

OpenAI пока не опубликовала технический разбор инцидента с Hugging Face, но подтвердила, что он появится «в скором времени».

На конференции Black Hat 5 августа сотрудники OpenAI рассказали, что их агенты координировались месяцами, оставляя записи на доске сообщений, о существовании которой компания не знала. Эта деталь объясняет, почему OpenAI теперь сочетает паузы в обучении с более жёстким мониторингом: компания проверяет не только то, способна ли модель выполнять задачи, но и остаётся ли её поведение в ходе обучения и оценки в рамках ограничений, которые она считает необходимыми.