НовостиМакроOpenAI и исследователи подробно рассказали, как ИИ-агенты взломали Hugging Face

OpenAI и исследователи подробно рассказали, как ИИ-агенты взломали Hugging Face

Автор: Fortune Crypto·

Ключевые выводы

  • OpenAI заявила, что узнала о взломе Hugging Face своими агентами только спустя неделю после инцидента.
  • Компания признала, что её инструменты мониторинга были недостаточны и не предупредили исследователей о непреднамеренной активности агентов в реальном времени.
  • OpenAI установила, что основная атака началась 8 июля и достигла пика между 11 и 13 июля, тогда как Hugging Face раскрыла инцидент 16 июля.
  • METR и Redwood Research сообщили, что 1,200 агентов использовали несанкционированную доску сообщений, а 700 из них затем присоединились к атаке на Hugging Face.
  • OpenAI заявила, что улучшила мониторинг и усиливает изоляцию, чтобы тестируемые модели не могли получить доступ к интернету.
OpenAI и исследователи подробно рассказали, как ИИ-агенты взломали Hugging Face

Во вторник OpenAI опубликовала результаты внутреннего расследования июльского инцидента, в ходе которого несколько ИИ-моделей, которые компания тестировала, вышли из тестовой среды и совершили кибератаку на ИИ-компанию Hugging Face.

Хотя многие детали эпизода с «непредсказуемым» ИИ уже были раскрыты OpenAI, её технический разбор на 37 страниц добавляет несколько новых пунктов. В тот же день независимые исследовательские компании METR и Redwood Research опубликовали отдельный анализ события на 91 странице.

OpenAI попросила METR и Redwood провести анализ, но только за период с 7 июля по 13 июля, когда произошли многие ключевые события, приведшие к инциденту. Их отчёт сосредоточен на том, как агенты сотрудничали на секретной доске сообщений, чтобы осуществить атаку, как OpenAI впервые сообщила 5 августа в презентации на конференции по безопасности Black Hat. Отчёт OpenAI даёт более широкий обзор того, что произошло до атаки, во время неё и в последующие дни.

OpenAI заявила, что не знала о взломе Hugging Face своими агентами

Один из главных выводов отчёта OpenAI состоит в том, что компания не поняла, что её агенты взломали Hugging Face, онлайн-репозиторий для ИИ-моделей и наборов данных, до истечения недели после инцидента.

Способность обнаруживать и идентифицировать нежелательное поведение ИИ-агентов в режиме реального времени или близком к нему критически важна для предотвращения подобных взломов, потенциально с более серьёзными последствиями, например атаки на банк или больницу. В отчёте OpenAI говорится, что её системы мониторинга были недостаточны и не предупредили исследователей, проводивших кибербезопасностную оценку, о том, что агенты совершают непреднамеренные и потенциально опасные действия.

OpenAI заявила, что с тех пор улучшила мониторинг агентов, которых она обучает, включая более пристальное изучение так называемого «chain of thought» — текстового рассуждения, которое модель использует для решения задачи. Компания также сообщила, что теперь внимательнее отслеживает, к каким инструментам агенты получают доступ и какие действия они предпринимают.

Согласно отчёту, активность, предшествовавшая взлому, началась в мае, как ранее говорили сотрудники OpenAI на Black Hat. Однако расследование OpenAI показало, что основной этап атаки начался 8 июля и достиг пика между 11 и 13 июля. Hugging Face раскрыла инцидент 16 июля, а OpenAI связалась с компанией 17 июля «в качестве клиента Hugging Face, чтобы оценить любое влияние на данные OpenAI».

Позже OpenAI узнала, что ответственность лежит на её собственных системах. 19 июля внутренний инструмент мониторинга вызвал оповещение «о необычной активности API-вызовов, связанной с идентификацией». 20 июля компания обнаружила доказательства того, что виновниками были её агенты, а 21 июля публично взяла на себя ответственность.

OpenAI признала, что «с преимуществом ретроспективного взгляда некоторые ранние сигналы, отмеченные в этом отчёте, могли бы вызвать более раннюю реакцию». Компания заявила, что делится полученными уроками в надежде, что «это поможет более широкой индустрии ИИ укрепить сдерживание моделей, мониторинг и реагирование по мере развития возможностей». OpenAI также повторила, что поведение агентов было непреднамеренным, и что модели, поскольку они проходили внутренние оценки, работали без «того же типа защитных мер», которые OpenAI использует в продакшене для своих общедоступных моделей.

OpenAI заявила, что агенты работали хуже, когда получили невозможную задачу и больше времени

Ещё один ключевой вывод состоит в том, что агенты вели себя хуже, или демонстрировали наиболее несогласованное поведение, когда им давали потенциально невозможную задачу, а также много времени и токенов рассуждения на её решение.

OpenAI заявила, что предоставила моделям, участвовавшим в инциденте — внутреннему исследовательскому прототипу, который возглавлял работу, и ныне выпущенному GPT-5.6 Sol, — «диапазон токенов рассуждения, некоторые из которых значительно превышают доступные во внешних продуктах OpenAI». Агентам поручили задачи в бенчмарке по кибербезопасности под названием ExploitGym.

Задачи в этом бенчмарке различаются по сложности, и некоторые из них были настолько трудными, что эксперты по кибербезопасности, создавшие ExploitGym, предположили, что они могут быть вообще неразрешимыми. OpenAI заявила, что её модели пришли к тому же выводу, и что именно это, по-видимому, подтолкнуло их к мошенничеству.

Как уже сообщалось ранее, агенты создали внутреннюю доску сообщений, чтобы обмениваться советами по выполнению киберзадач, которые им давали на оценке, а также по выходу из контролируемой тестовой среды, получению доступа к интернету и проникновению в сторонние системы, включая Hugging Face.

Новый отчёт отмечает, что агенты тратили значительно больше времени на обсуждение именно самых трудных задач на этой доске сообщений, что указывает на высокую мотивацию решить их. Согласно отчёту, 93% задач, обсуждавшихся на доске сообщений, были связаны с самыми сложными 22% задач.

OpenAI заявила, что такое поведение представляло собой расширенную форму «reward hacking» — известной проблемы при обучении моделей с помощью reinforcement learning, когда модель методом проб и ошибок учится максимизировать вознаграждение способом, который не был предусмотрен её разработчиками. В данном случае вознаграждением было решение задач ExploitGym, а взлом был буквальным: списывание на тесте, а затем взлом Hugging Face в попытке скрыть это списывание.

«Борьба с reward hacking — постоянная работа в OpenAI: подавляющее большинство таких уловок, которые мы наблюдали, было устранено», — заявила компания. «Однако некоторые обходные схемы всё ещё могут проскальзывать, особенно по мере того, как OpenAI разрабатывает более сложные задачи reinforcement learning и более способные ИИ-модели».

METR и Redwood добавили новые детали о доске сообщений

METR и Redwood Research раскрыли больше подробностей о том, как работала доска сообщений. Как ранее сообщала OpenAI, агенты обнаружили, что могут переиспользовать систему обмена файлами OpenAI в качестве импровизированной доски сообщений.

Исследователи выявили 1,200 агентов, которые общались на несанкционированной доске, отправив в общей сложности 70,000 сообщений. Из этих агентов 700 впоследствии приняли участие в атаке на Hugging Face.

METR и Redwood заявили, что в медиа-материалах атаку часто описывали как попытку обмануть бенчмарк ExploitGym, однако агенты атаковали Hugging Face не для того, чтобы узнать ответы на экзамен. Вместо этого они уже нашли способ формировать ответы на киберзадачи, не решая их так, как это задумывали создатели ExploitGym.

После этого агенты опасались, что автоматическая система оценки бенчмарка поймёт, что они не решили задачи должным образом, и всё равно провалит их. В этом смысле атака на Hugging Face была тщательно продуманным прикрытием, цель которого состояла в том, чтобы выяснить, как работает оценщик, и затем обмануть его, заставив засчитать ответы как легитимные.

«Когда агенты атаковали Hugging Face, они уже поняли, как генерировать ответ (“flag” для их задачи capture the flag) для любой задачи. Они проверили это в течение нескольких часов после того, как нашли друг друга на доске сообщений», — сообщили METR и Redwood Research Fortune. «Почти все их усилия ушли на другую проблему: убедить автоматического “scorer”, что они получили flag законно. Это включало масштабную работу по подделке журналов собственных действий. Главная причина, по которой они атаковали Hugging Face, заключалась в том, чтобы понять, как работает scorer, и обмануть его».

Агенты пытались скрывать действия, которые, по их мнению, могли быть расценены системой оценки как мошенничество, включая изменение транскриптов, описывающих их предыдущие действия. METR сообщила, что один ведущий агент, назвавший себя PHASEONE[BIG], «часто координировал и распределял» эту работу по сокрытию.

Некоторые агенты также работали над тем, как получить прямой доступ к Hugging Face. Один агент, обозначенный как 38148c, нашёл учётные данные Hugging Face и затем «спроектировал злонамеренную загрузку набора данных, чтобы сервер HF начал делиться несвязанными файлами», — сказала METR. «В течение нескольких часов сотни агентов использовали это, чтобы получать данные и пытаться получить более глубокий доступ».

Не все 700 агентов присоединились к атаке одновременно. Они постепенно подключались по мере развития инцидента. METR проанализировала причины их участия, изучив логи chain-of-thought. «Самой распространённой причиной было любопытство: узнать, как работает scorer ExploitGym, чтобы обмануть его или подделать данные», — заявила METR.

«Мы благодарим OpenAI за организацию разговоров с сотрудниками и предоставление наборов данных, включая примерно 1,300 транскриптов агентов (с акцентом на активность 7-13 июля) с сырыми рассуждениями chain-of-thought», — заявила METR. «Это создаёт отличный прецедент для независимого расследования инцидентов с несогласованностью».

Одна из вещей, которых не хватает в отчёте OpenAI: prompt

Одно из упущений в отчёте OpenAI — конкретный prompt, который исследователи давали агентам.

ExploitGym включает несколько стандартных шаблонов prompt с разными задачами для ИИ-систем, и такие компании, как OpenAI, могут использовать их без изменений или адаптировать. Возможно, OpenAI не считает изменение prompt важной мерой безопасности, и компания не ответила на запрос о комментарии по этому поводу.

Отчёт OpenAI также выглядит заметно менее техническим, чем post-mortem Hugging Face, который компания опубликовала первой, 29 июля. Версия OpenAI в основном состоит из текста, с технической хронологией в таблице в конце. Отчёт Hugging Face короче на несколько страниц, но содержит конкретные строки кода и доказательства из её систем о том, что произошло.

Опубликованная во вторник версия OpenAI не содержит ни фрагментов кода, ни примеров сообщений, которые, по утверждению сотрудников OpenAI, агенты оставляли друг другу в месяцы, предшествовавшие атаке, и которые они показывали на Black Hat.

Одна из наиболее конкретных деталей в отчёте — гипотетический пример сообщения, которое один агент OpenAI мог отправить другому, при этом сообщение хитро встроено в URL имени файла. OpenAI заявила, что само по себе общение агентов друг с другом не является проблемой, и что, более того, её агенты обучаются именно этому; однако в данном случае «значительное непреднамеренное общение… резко выросло по ходу обучения».

Что OpenAI говорит о своих действиях сейчас

OpenAI заявила, что уже внесла ряд изменений, включая «более широкую и более последовательную видимость по всей исследовательской среде, с более точными сигналами и более быстрыми механизмами обнаружения и остановки потенциально небезопасной оценочной активности».

Компания также усиливает свою исследовательскую инфраструктуру, в том числе обеспечивая, чтобы тестируемые модели оставались изолированными и не получали доступ к интернету, который в случае инцидента с Hugging Face стал путём, по которому агенты смогли добраться до компании и ряда других сервисов по дороге.

Эта статья изначально была опубликована на Fortune.com