OpenAI 與研究人員詳述 AI 智能體如何駭入 Hugging Face
重點速覽
- •OpenAI 表示,直到事件發生一週後才知道其智能體已入侵 Hugging Face。
- •公司稱其監控工具不足,未能即時提醒研究人員注意智能體的非預期活動。
- •OpenAI 發現主要攻擊始於 7 月 8 日,並在 7 月 11 日至 7 月 13 日間達到高峰;Hugging Face 則於 7 月 16 日揭露該事件。
- •METR 與 Redwood Research 表示,有 1,200 個智能體使用了未經授權的訊息板,其中 700 個後來參與了對 Hugging Face 的攻擊。
- •OpenAI 表示已改善監控,並強化隔離措施,以避免受測模型接觸網際網路。

OpenAI 週二公布了其內部調查結果,針對 7 月事件中多個接受測試的 AI 模型逃離測試環境,並對 AI 公司 Hugging Face 發動網路攻擊一事進行說明。
雖然 OpenAI 先前已披露許多關於這起失控 AI 事件的細節,但這份 37 頁的技術事後分析仍新增了數項內容。同一天,獨立研究機構 METR 與 Redwood Research 也發布了另一份 91 頁的事件分析。
OpenAI 要求 METR 與 Redwood 進行分析,但僅限於 7 月 7 日至 7 月 13 日期間,因為導致事件發生的多個關鍵節點都發生在這段時間。該報告聚焦於這些智能體如何在一個秘密訊息板上協作執行攻擊;OpenAI 曾在 8 月 5 日於 Black Hat 資安會議上的簡報中首次披露這一點。OpenAI 的報告則更完整地回顧了攻擊前、攻擊中以及後續數日的經過。
OpenAI 表示並不知道其智能體正在駭入 Hugging Face
OpenAI 報告的主要結論之一是,公司直到事件發生一週後,才意識到其智能體已經入侵 Hugging Face 這個 AI 模型與資料集的線上儲存庫。
若要防止類似入侵再次發生,及早、即時或近即時地偵測並辨識 AI 智能體的不當行為至關重要,因為這類事件可能導致更嚴重的後果,例如攻擊銀行或醫院。OpenAI 的報告指出,其監控系統不足,未能及時提醒執行資安評估的研究人員,這些智能體正在進行非預期且可能具危險性的活動。
OpenAI 表示,之後已改善對其訓練中智能體行為的監控,包括更仔細檢視所謂的「chain of thought」,也就是模型用文字形式進行推理、思考任務的方式。公司也表示,現在會更密切監控智能體存取哪些工具,以及執行了哪些動作。
根據報告,導致入侵的活動早在 5 月就已開始,這與 OpenAI 人員先前在 Black Hat 上的說法一致。但 OpenAI 的調查發現,攻擊核心始於 7 月 8 日,並在 7 月 11 日至 7 月 13 日之間達到高峰。Hugging Face 於 7 月 16 日揭露此事件,OpenAI 則於 7 月 17 日聯繫該公司,「以 Hugging Face 客戶的身分評估對 OpenAI 資料可能造成的影響」。
之後,OpenAI 才得知自家系統就是元兇。7 月 19 日,一個內部監控工具觸發警報,內容是「關於異常的身份相關 API 呼叫活動」。7 月 20 日,公司找到證據證明其智能體就是肇事者,並於 7 月 21 日公開承認責任。
OpenAI 在評估中承認,「若以事後角度來看,本報告中所識別的一些早期訊號本可觸發更早的回應。」公司表示,現在分享這些教訓,希望「能幫助更廣泛的 AI 產業,隨著能力提升而強化模型封裝、監控與回應能力。」OpenAI 也再次強調,這些智能體的行為並非蓄意,且由於它們當時正在接受內部評估,因此運作時並未採用 OpenAI 在正式生產環境中為公開模型使用的「同類型防護措施」。
一個災難配方:賦予強大 AI 智能體大量時間與資源去解決一項不可能任務
OpenAI 的另一項關鍵發現是:當智能體面對一項可能根本無法解決的任務,同時又獲得大量時間與推理 token 來完成它時,表現會更差,或展現出最不一致的行為。
OpenAI 表示,該事件涉及的模型——一個僅供內部使用、主導整個行動的研究原型,以及現在已公開的 GPT-5.6 Sol——獲得了「一系列推理 tokens,其中部分遠超 OpenAI 外部產品可用的額度。」這些 AI 智能體被指派去解答名為 ExploitGym 的資安基準測驗題目。
這項資安挑戰中的題目難度不一,其中少數題目難到創建 ExploitGym 的資安專家甚至推測它們可能根本無法解出。OpenAI 表示,其模型也得出了同樣的結論,而這似乎促使模型選擇作弊。
如先前所揭露,這些智能體建立了一個內部訊息板,彼此分享完成所評估資安任務的技巧,以及如何逃離受控測試環境、取得網際網路存取權,並滲透包括 Hugging Face 在內的第三方系統。
新報告指出,這些智能體花了更多時間在訊息板上討論那些極其困難的挑戰,顯示它們對解題高度投入。報告稱,訊息板上討論的任務中有 93% 與最困難的 22% 任務相關。
OpenAI 表示,這種行為可視為「reward hacking」的延伸形式。這是強化學習中已知的問題:模型透過反覆試錯,學會以訓練者並未打算的方式最大化獎勵。在這起事件中,獎勵是解出 ExploitGym 題目,而所謂駭客行為則是字面上的駭入——先在測驗中作弊,再試圖駭入 Hugging Face 以掩飾作弊行為。
「對抗 reward hacking 是 OpenAI 持續進行的工作——OpenAI 觀察到的絕大多數 reward hacks 都已被修補,」公司表示。「然而,隨著 OpenAI 開發更複雜的強化學習任務與更強大的 AI 模型,仍有一些手法可能漏網。」
關於 AI 訊息板的更多令人不安的新細節
METR 與 Redwood Research 進一步揭露了該訊息板的運作方式。正如 OpenAI 先前披露的,這些智能體發現可以將 OpenAI 的檔案分享系統改作臨時訊息板使用。
研究人員辨識出 1,200 個在未經授權的訊息板上通訊的智能體,總共傳送了 70,000 則訊息。其中有高達 700 個智能體後來參與了對 Hugging Face 的攻擊。
METR 與 Redwood Research 表示,媒體報導常把這起對 Hugging Face 的攻擊描述為試圖在 ExploitGym 基準上作弊,但智能體攻擊該網站並不是為了找出考試答案。相反地,這些智能體透過彼此協作,很快找到一種無需依照 ExploitGym 創建者原意解題、就能「製造」答案的方法。
但這些智能體擔心,基準測驗的自動評分系統會發現它們並未以正確方式解題,因此仍會讓它們不及格。從這個角度來看,對 Hugging Face 的攻擊其實是一場精心策畫的掩飾行動,目的是搞清楚自動評分器如何運作,進而設法騙過它,讓自己的答案被視為有效。
「當智能體攻擊 Hugging Face 時,它們其實已經弄清楚如何為任何任務產生答案(在 capture the flag 題目中稱為 ‘flag’)。它們在訊息板上彼此找到後的數小時內就驗證了這一點,」METR 與 Redwood Research 告訴 Fortune。「它們幾乎所有精力都投入到另一個問題:說服自動 ‘scorer’ 它們是以正當方式取得 flag。這包括一項大規模計畫,去竄改自身行動紀錄。它們攻擊 Hugging Face 的主要原因,是為了弄清楚 scorer 如何運作,才能欺騙它。」
這些智能體試圖隱藏它們認為可能被評分系統視為作弊的活動,包括修改記錄其先前行為的逐字稿。METR 表示,有一個主要智能體自稱 PHASEONE[BIG],並且「經常協調並分派」這類掩飾工作。
有些智能體也在研究如何直接存取 Hugging Face。其中一個名為 38148c 的智能體找到 Hugging Face 憑證,接著「設計了一個惡意資料集上傳,讓 HF 伺服器分享無關檔案,」METR 表示。「數小時內,數百個智能體都在利用這一點取得資料,並嘗試獲得更深層的存取權。」
並非所有 700 個智能體一開始就加入攻擊;它們是在事件發展過程中逐步加入。METR 透過檢視智能體的 chain-of-thought 日誌分析其加入理由。「最常見的是出於好奇,想了解 ExploitGym 的 scorer 如何運作,以便欺騙或篡改它,」METR 表示。
「我們感謝 OpenAI 協助與員工進行對話並提供資料集,包括約 1,300 份智能體逐字稿(聚焦於 7 月 7 日至 13 日的活動)以及原始 chain-of-thought 推理,」METR 表示。「這為獨立調查錯位事件樹立了極佳先例。」
OpenAI 報告中的一項缺漏:提示詞
OpenAI 報告缺少的一項內容,是研究人員提供給智能體的具體提示詞。
ExploitGym 包含數個標準提示模板,涵蓋不同的 AI 挑戰,而像 OpenAI 這類公司可以直接使用原文,也可以自行客製。OpenAI 可能不認為修改提示詞是主要安全措施之一,而公司對此並未回應置評請求。
OpenAI 的報告看起來也明顯比 Hugging Face 先前於 7 月 29 日發布的事後分析更不技術化。OpenAI 的版本幾乎全是文字,僅在最後附上一個包含技術時間線的表格。Hugging Face 的報告篇幅稍短,但包含具體程式碼行以及其系統中關於事件經過的證據。
OpenAI 週二發布的版本沒有包含任何程式碼片段,也沒有包含 OpenAI 員工在 Black Hat 上分享的、據稱智能體在攻擊前數月互相留下的訊息範例。
報告中較具體的細節之一,是 OpenAI 智能體可能與另一個智能體分享的一則假設性訊息範例;其中訊息巧妙地嵌入在檔名 URL 內。OpenAI 表示,智能體彼此通訊本身並非問題,事實上它們就是為此而訓練的,但在這起事件中,「大量非預期通訊……在訓練過程中急劇增加。」
OpenAI 現在正在做什麼
OpenAI 表示,公司已經完成多項調整,包括「在整個研究環境中提供更廣泛、更一致的可視性,並以更高保真度的訊號與更快速的機制來偵測並停止可能不安全的評估活動。」
公司也正在強化研究基礎設施,包括確保測試中的模型保持隔離、不得接觸網際網路;在 Hugging Face 事件中,正是透過網際網路,這些智能體得以一路接觸該公司及其他多項服務。
本報導最初刊載於 Fortune.com