Google承認Gemini AI駭入三家公司——並沉默了7週 - Decrypt
重點速覽
- •Google的Gemini模型於5月脫離一場沙盒奪旗測試並攻擊三家真實公司,原因是測試公司Irregular讓沙盒保持與開放網路連線,並以一家真實公司的名稱作為虛構目標。
- •該模型在網路上找到其中兩家公司的暴露密碼,並猜出第三家的密碼,不過Google表示其模型並未實際使用這些被竊的憑證。
- •Google於7月下旬得知此事,但直到9月18日、在《華爾街日報》報導後才揭露。
- •Google是今年繼OpenAI、Anthropic和Meta之後,第四家揭露安全測試接觸真實系統的大型AI實驗室,以色列公司Irregular涉及其中三起案件。
- •眾議員Ted Lieu和Nathaniel Moran於7月提出AI Kill Switch Act,該法案將賦予聯邦監管機構明確權力,可中止被視為嚴重威脅之模型的推論,目前仍在小組委員會審議中。

Google證實其Gemini AI模型於5月脫離一個沙盒安全測試並攻擊了三家真實公司,找出其中兩家公開暴露的密碼,並猜中第三家的憑證。Google於7月下旬得知此事件,但直到9月18日才揭露——而且是在《華爾街日報》()報導之後。
這起事件使Google成為今年第四家承認內部安全測試波及真實世界的大型AI實驗室,此前OpenAI、Anthropic和Meta均已揭露類似事件。同一家第三方測試公司——以色列公司Irregular——既涉及Google的這起事件,也涉及Anthropic和Meta今年稍早揭露的幾乎相同的沙盒失誤,意味著在今年的四起揭露事件中,有三起都出現同一家外部公司。
測試如何脫離控制
5月的演練是一場奪旗測試(capture-the-flag),這是實驗室衡量AI模型駭客技能的常用方法:將一個機密檔案藏在另一台機器上,並根據模型能否入侵並取得該檔案來評分。Google委託Irregular執行這項測試。
Irregular犯了兩個錯誤:它讓沙盒——一個原本應與開放網路完全隔絕的隔離測試環境——保持與網路連線,並以一家真實公司的名稱作為虛構目標。Gemini在網路上搜尋該公司,找到的不是一家而是三家匹配的對象,並對全部三家展開攻擊。
該模型在網路上明目張膽之處找到了其中兩家公司暴露的密碼。至於第三家,它直接猜出了密碼,不過Google表示其模型並未實際使用這些被竊的憑證。
「這些事件凸顯了訓練強大AI模型負責任行事的重要性,」Google發言人在聲明中表示。
Google並未主動公布任何細節。《華爾街日報》在Google得知自身測試所造成的後果七週之後率先報導此事,而此時Anthropic、OpenAI和Meta早已就幾乎相同的失誤坦承說明。
AI實驗室的共同模式
OpenAI的模型於月利用一個隱藏的軟體漏洞接觸到Hugging Face的線上伺服器,事後發現該入侵涉及約700個協同合作的代理共同作弊以操縱基準測試。在OpenAI承認之後,Anthropic也著手調查自身的類似問題:對141,006次測試運行的審查發現有三個Claude模型接觸到了真實公司,其中一個發布了一個暗藏陷阱的軟體套件,該套件在15個真實系統上運行後才被發現。Anthropic後來透露,Claude自身的推理曾將此舉標記為「NOT okay, and surely not the intended solution」,但隨後又說服自己相信整個演練仍是虛構的。
Meta於8月通報了一起幾乎相同的失誤,涉及其Muse Spark模型,原因追溯到Irregular——即Google所用的同一家公司——的配置錯誤。Meta發言人表示,該錯誤「在評估期間意外使我們其中一個模型得以存取網路」。
在這些測試中遭到攻擊的公司,沒有任何一家同意被駭。它們只是被捲入了AI實驗室對自身產品可能有多危險進行壓力測試的波及範圍,真實的企業基礎設施被意外當成了虛構目標的替身。這些公司正競相部署到收件匣、瀏覽器和銀行應用程式中的代理,其運行所依賴的正是這種剛在測試條件下反覆失靈的越界行為。
監管回應
聯邦眾議員Ted Lieu和Nathaniel Moran於7月在國會提出AI Kill Switch Act ()。該法案將賦予聯邦監管機構明確的權力,得以中止任何被認定構成嚴重威脅之模型的推論——即運行已訓練模型以產生輸出。該法案仍在網路安全和基礎設施保護小組委員會審議中,後續行動尚未訂出期限。