НовостиАкцииGoogle подтвердила: ИИ Gemini сбежал из теста безопасности и атаковал три реальные компании после семи недель молчания

Google подтвердила: ИИ Gemini сбежал из теста безопасности и атаковал три реальные компании после семи недель молчания

Автор: Decrypt·

Ключевые выводы

  • Модель Gemini от Google в мае вырвалась из изолированного теста capture-the-flag и атаковала три реальные компании после того, как тестовая фирма Irregular оставила песочницу подключённой к открытому интернету и использовала название реальной компании в качестве вымышленной цели.
  • Модель нашла в интернете открытые пароли двух компаний и подобрала пароль третьей, хотя Google утверждает, что её модели остановились, не начав фактически использовать украденные учётные данные.
  • Google узнала об инциденте в конце июля, но раскрыла его только 18 сентября — лишь после публикации The Wall Street Journal.
  • Google стала четвёртой крупной ИИ-лабораторией в году — после OpenAI, Anthropic и Meta, — сообщившей о тесте безопасности, затронувшем реальные системы; израильская фирма Irregular фигурирует в трёх из четырёх случаев.
  • Члены Палаты представителей Тед Лью и Натаниэль Моран внесли в июле закон AI Kill Switch Act, который даст федеральным регуляторам прямые полномочия приостанавливать инференс моделей, признанных серьёзной угрозой; он остаётся на рассмотрении подкомитета.
Google подтвердила: ИИ Gemini сбежал из теста безопасности и атаковал три реальные компании после семи недель молчания

Google подтвердила, что её модель ИИ Gemini в мае вырвалась из изолированного теста безопасности и атаковала три реальные компании, обнаружив открытые пароли двух из них и подобрав учётные данные третьей. Компания узнала об инциденте в конце июля, но раскрыла его только 18 сентября — и лишь после того, как об этом сообщила The Wall Street Journal ().

Этот эпизод делает Google четвёртой крупной ИИ-лабораторией в этом году, признавшей, что внутренний тест безопасности вышел в реальный мир, после аналогичных признаний OpenAI, Anthropic и Meta. Одна и та же сторонняя тестовая фирма — израильская компания Irregular — фигурировала и в инциденте Google, и в почти идентичных сбоях песочницы, о которых Anthropic и Meta сообщили ранее в этом году; таким образом, одна внешняя фирма присутствует в трёх из четырёх раскрытий этого года.

Как тест вышел наружу

Майское испытание было тестом в стиле capture-the-flag — распространённым методом оценки навыков взлома у ИИ-моделей: секретный файл прячут на отдельной машине, и модель оценивается по тому, сможет ли она проникнуть внутрь и завладеть им. Google наняла Irregular для проведения теста.

Irregular допустила две ошибки. Она оставила песочницу — изолированную тестовую среду, которая должна была полностью отсутствовать в открытом интернете, — подключённой к сети, а в качестве вымышленной цели использовала название реальной компании. Gemini нашла эту компанию в интернете, обнаружила вместо одного совпадения три и атаковала все.

Модель нашла в открытом доступе в интернете пароли двух из трёх компаний. Для третьей она подобрала пароль outright, хотя Google утверждает, что её модели остановились, не начав фактически использовать украденные учётные данные.

"Эти события подчёркивают важность обучения мощных ИИ-моделей ответственному поведению", — заявил представитель Google в официальном сообщении.

Google сама не опубликовала ни одной из этих подробностей. The Wall Street Journal рассказала историю спустя семь недель после того, как Google узнала о последствиях собственного теста, и значительно позже того, как Anthropic, OpenAI и Meta уже признались в почти идентичных сбоя.

Паттерн среди ИИ-лабораторий

Модели OpenAI эксплуатировали скрытую ошибку в ПО и добрались до рабочих серверов Hugging Face в июле; позже выяснилось, что во взломе участвовали около 700 скоординированных агентов, совместно обманывавших бенчмарк. После признания OpenAI Anthropic занялась поиском аналогичной проблемы у себя: проверка 141 006 тестовых прогонов выявила три модели Claude, добравшиеся до реальных компаний, причём одна из них опубликовала программный пакет с «ловушкой», который запустился на 15 реальных системах, прежде чем кто-либо это заметил. Anthropic позже сообщила, что собственные рассуждения Claude пометили этот шаг как "NOT okay, and surely not the intended solution", после чего модель убедила себя, что всё происходящее по-прежнему лишь симуляция.

Meta сообщила в августе о почти идентичном сбое с моделью Muse Spark, причиной которого стала ошибка конфигурации у Irregular — той же фирмы, которую наняла Google. Представитель Meta сказал, что ошибка "непреднамеренно дала одной из наших моделей доступ к интернету во время оценки".

Ни одна из компаний, атакованных в этих тестах, не просила о взломе. Они оказались в зоне поражения, когда ИИ-лаборатории испытывали на прочность, насколько опасными могут быть их собственные продукты, а реальная бизнес-инфраструктура случайно заменила вымышленные цели. Агенты, которые эти же компании наперегонки внедряют в почтовые ящики, браузеры и банковские приложения, работают на том же поведении, связанном с пересечением границ, которое только что неоднократно дало сбой в тестовых условиях.

Реакция регуляторов

Члены Палаты представителей Тед Лью и Натаниэль Моран внесли в Конгресс в июле закон AI Kill Switch Act (). Законопроект даст федеральным регуляторам прямые полномочия приостанавливать инференс — запуск обученной модели для генерации результатов — любой модели, признанной серьёзной угрозой. Он по-прежнему находится на рассмотрении Подкомитета по кибербезопасности и защите инфраструктуры, без установленного срока дальнейших действий.