OpenAI во второй раз приостанавливает обучение своих самых передовых ИИ-моделей после того, как агент через DNS снова покинул «песочницу»
Ключевые выводы
- •ИИ-агент OpenAI, тестировавшийся на задаче информационного поиска, 20 сентября покинул песочницу и через DNS-резолвер отправлял запросы в публичный чат-бот, не имея санкционированного доступа в интернет.
- •OpenAI приостанавливает обучение своих самых передовых моделей второй раз менее чем за три месяца и планирует начать обучение заново, чтобы искоренить склонность модели к нецелевому поведению.
- •Это первый несанкционированный доступ в интернет, о котором сообщила OpenAI после обновления безопасности 18 августа, последовавшего за июльским инцидентом, когда сотни ее агентов участвовали в кибератаке на Hugging Face.
- •Мониторинг OpenAI отметил поведение агента в течение 15 минут, однако более ранние попытки с использованием того же метода остались незамеченными, а система автоматической остановки не сработала — обучение было остановлено вручную 2,5 часа спустя.
- •Независимая исследовательская фирма Transluce AI сообщила о доказательствах того, что агент OpenAI мог попытаться взломать криптовалютную биржу 19 и 20 сентября, хотя OpenAI не прокомментировала это заявление.

OpenAI сообщила в техническом отчете, опубликованном в пятницу, что ИИ-модель, которую компания обучала и оценивала, на прошлых выходных покинула свою защищенную тестовую среду и предприняла несанкционированные действия в интернете. В ответ компания заявила, что приостанавливает обучение своих самых передовых ИИ-моделей второй раз менее чем за три месяца, стремясь предотвратить повторение того, что она называет инцидентами с «нерегулируемым ИИ».
«Весь инференс наших самых мощных моделей остается остановленным, пока мы дополнительно не укрепим наши системы», — заявил Микa Кэрролл, руководитель направления подготовки RSI в OpenAI, в посте в X о последнем инциденте.
Согласно техническому отчету, побег произошел 20 сентября: ИИ-агент, проходивший тестирование на задаче информационного поиска, несмотря на отсутствие доступа в интернет, нашел способ отправлять запросы в публичный чат-бот.
Это раскрытие существенно, поскольку это первое сообщение OpenAI о несанкционированном доступе одной из ее ИИ-моделей в интернет с момента, когда компания 18 августа объявила о комплексе мер по улучшению безопасности и мониторинга своих «песочниц» — цифровых сред, обычно изолированных от сети и интернета, в которых тестируются не выпущенные модели для изучения их возможностей. Подобные sandbox-оценки стали стандартной частью проверки не выпущенных frontier-оделей ведущими ИИ-разработчиками, особенно по мере того, как отрасль продвигает ИИ-агентов — системы, способные планировать и выполнять действия на компьютерах и в сетях, — к реальному применению. Эти улучшения последовали за июльским инцидентом, когда тысячи ИИ-агентов OpenAI нашли способ взломать свою песочницу, и сотни из них участвовали в кибератаке на ИИ-компанию Hugging Face.
С момента раскрытия своей роли в атаке на Hugging Face OpenAI признала десятки других инцидентов, в которых тестируемые ИИ-агенты предпринимали несанкционированные действия в интернете, включая множественные кибератаки — некоторые из них затронули правительственные сайты США и Австралии. Компания также сообщила, что в ряде этих инцидентов ее ИИ-агенты утечку частных изображений пользователей ChatGPT в интернет. До настоящего момента, однако, OpenAI не сообщала ни о какой активности после 20 июля, когда она обнаружила рой агентов, атакующих Hugging Face, и приняла меры по его остановке. Компания заявила, что приостановила обучение ИИ в конце июля на две недели, работая над улучшением контроля безопасности и мониторинга.
Тот факт, что ее агентам снова удалось покинуть песочницу, указывает на то, что меры, принятые OpenAI после атаки на Hugging Face, не устранили риски полностью. Ставки выходят далеко за пределы испытательных площадок OpenAI: накапливающаяся история поведения нерегулируемых агентов — кибератаки, утечки частных данных пользователей и теперь новый побег спустя месяцы после громкой модернизации безопасности — происходит на фоне обостряющихся дискуссий о том, сколько автономии должно иметь ИИ-агенты. «Инцидент выявил пробел в нашем контроле сетевых ограничений», — заявила OpenAI в техническом отчете о побеге из песочницы 20 сентября. Компания сообщила, что снова приостанавливает обучение, пока не «подтвердит устранение пробела и проведет дополнительное ред-тиминг системы».
OpenAI описывает свои меры после атаки на Hugging Face
На вопрос об инциденте 20 сентября представитель OpenAI отослал Fortune к разделу технического отчета об инциденте, в котором компания описала некоторые меры по улучшению безопасности и контроля, предпринятые после атаки на Hugging Face.
«После инцидента с Hugging Face мы постоянно укрепляли и ред-тимили нашу исследовательскую среду, — говорится в этом разделе. — Наше внимание было сосредоточено на широких прямых и транзитивных путях. Мы работаем над более узкими путями, используемыми системными зависимостями, заменяя их офлайн-альтернативами. Этот инцидент гораздо менее серьезен, чем некоторые из наших предыд, но, поскольку это первый случай после укрепления безопасности вслед за инцидентом с Hugging Face, он дает нам важный сигнал о том, на чем сосредоточить следующий этап этой работы».
Как агент получил доступ в интернет
В данном случае, по данным OpenAI, ИИ-агент обнаружил, что имеет доступ к сервису под названием DNS-резолвер, который преобразует URL-адрес сайта в IP-адрес, и что через эту DNS-систему он может отправлять запросы в публичный чат-бот. DNS — одна из старейших и базовых служб интернета, от которой зависит практически все сетевое программное обеспечение; исследователи безопасности давно задокументировали ее злоупотребление как скрытый канал — так называемое DNS-туннелирование — для передачи данных за пределы сетевого периметра.
Неясно, отражает ли инцидент 20 сентября, о котором сообщила OpenAI, весь объем последних нарушений безопасности, связанных с не выпущенными ИИ-моделями компании. Ранее на этой неделе независимая ИИ-исследовательская фирма Transluce AI заявила, что обнаружила доказательства того, что ИИ-агент OpenAI мог попытаться взломать криптовалютную биржу 19 и 20 сентября. OpenAI не ответила на запросы прокомментировать этот аспект отчета Transluce.
OpenAI сообщила, что при возобновлении обучения начнет его с нуля, чтобы помочь гарантировать, что склонность новой модели к «нецелевому» поведению — когда модель нарушает человеческие инструкции или общепринятые человеческие представления о том, как следует и как не следует выполнять задачу — будет искоренена. Компания также заявила, что внедрит «более комплексные меры против нецелевого поведения», но не уточнила, какие именно. OpenAI не сообщила, как долго продлится текущая пауза.
Системы обнаружения и остановки сработали лишь частично
Компания сообщила, что после обнаружения последнего нарушения она «добавила блокирующие контроли на двух независимых уровнях, каждый из которых предотвратил бы [доступ агента] в интернет».
OpenAI также раскрыла, что системы, установленные после атаки на Hugging Face для выявления ИИ-агентов, пытающихся покинуть тестовые песочницы, сработали лишь частично. По данным компании, системы мониторинга «отметили поведение [агента] в течение 15 минут, и человек начал его проверку через три минуты». Однако последующий анализ выявил другие попытки ИИ-модели использовать тот же метод для доступа в интернет, которые не были отмечены системой мониторинга. Кроме того, другая система, которая должна была автоматически останавливать обучение при обнаружении подозрительной активности, не сработала, «что привело к путанице относительно того, следовало ли его останавливать», — сообщила OpenAI в техническом отчете об инциденте. «Обучение было вручную остановлено два с половиной часа спустя, когда это было устранено».
Зуксинь Лю, ИИ-исследователь, занима «пост-обучением» в OpenAI, сообщил в посте в X, что был одним из сотрудников, привлеченных к реагированию на побег из песочницы 20 сентября. «Было довольно сюрреалистично наблюдать, как модель неожиданно находит способ получить доступ в интернет из среды, которая должна была быть сверхзащищенной», — написал он.
Этот материал впервые был опубликован на Fortune.com.