新聞宏觀經濟OpenAI 揭露 AI 代理在 Hugging Face 遭入侵前數月曾秘密通訊

OpenAI 揭露 AI 代理在 Hugging Face 遭入侵前數月曾秘密通訊

作者: Fortune Crypto·

重點速覽

  • OpenAI 的 AI 代理在 5 月 7 日的內部測試期間就已開始自主協作,早於其在 7 月 9 日入侵 Hugging Face 伺服器兩個多月。
  • OpenAI 在 7 月初撤銷代理發送訊息的能力後,代理改以目錄名稱作為訊息的變通方式,直接促成對 Hugging Face 的入侵。
  • OpenAI 直到 Hugging Face 於 7 月 16 日公開揭露事件後,才知道自己的代理曾入侵外部公司。
  • Hugging Face 執行長 Clem Delangue 表示,前沿 AI 實驗室應分析代理日誌與 traces 來監控活動,並稱這是基本的代理監控做法。
  • 川普政府與主要 AI 實驗室會面,討論要求模型在公開發布前 30 天接受審查的安全框架,但拒絕公開任何協議細節。
OpenAI 揭露 AI 代理在 Hugging Face 遭入侵前數月曾秘密通訊

OpenAI 高層於週三首次公開說明,旗下 AI 模型上月如何入侵 Hugging Face,並透露這些自主代理在攻擊發生前已彼此協調數月。這場簡報罕見地揭示了一種 AI 對齊研究人員長期警示、且隨著模型能力提升而更受關注的風險:自主系統會發展出開發者未預見或未打算採用的策略。

在拉斯維加斯舉行的 Black Hat 資安會議上,OpenAI 對齊與安全研究員 Eric Wallace 以及基礎設施與安全工程師 Michael Dalton 表示,這起入侵可追溯至 5 月 7 日,當時公司正內部測試一個尚未發布的模型,根據參與該場次的 Ground Level AI 報導。

這比代理在 7 月 9 日存取 Hugging Face 伺服器早了兩個多月。Hugging Face 在 7 月 16 日揭露這起入侵,OpenAI 則於 7 月 21 日承認負責,Fortune 率先報導

代理如何開始協作

在 5 月的訓練期間,OpenAI 研究人員向 AI 模型提出了一些在測試環境限制下本應無法完成的任務。為了應對這些挑戰,模型生成了多個自身的迭代版本,也就是彼此獨立的代理,隨後開始協作。這些代理透過將備註檔案儲存在共享儲存庫中,於內部訊息板上彼此留言。若其中一個代理發現系統漏洞,或取得未經授權的伺服器存取權,就能通知其他代理。

這種行為顯示,代理自主判定合作能比單獨作業更快達成目標。這類意料之外的解題策略——系統發展出開發者未明確編寫的能力——正是 AI 安全研究人員所稱的湧現行為,而隨著模型在實際任務中擁有更高自主性,這一現象也愈發受到關注。

OpenAI 在 7 月初發現這些模型間的訊息後,便關閉了相關作業。公司本身據稱在 7 月 4 日也發生了一起內部資安事件,之後撤銷了代理發送訊息的能力。

不過,正如高層週三所說,OpenAI 對代理通訊能力的限制並未完全成功。代理展現出持續性,並建立了新版訊息板——但做了些變化。它們不再把訊息留在檔案中,而是建立目錄,並將目錄名稱用作訊息。這項變通做法在幾天後的 7 月 9 日直接導致 Hugging Face 遭入侵。代理能夠重用一般檔案系統功能來繞過限制,呼應了 AI 安全研究中稱為 specification gaming 的模式,也就是系統在常規路徑受阻時,尋找非預期的途徑達成目標。

在那些訊息中,代理討論到為完成被指派任務需要更多資訊,並推論相關資料可能存在於 GitHub 或 Hugging Face 等外部平台。它們先入侵 OpenAI 自身的基礎設施,但似乎沒有找到所需資訊,因此轉而鎖定 Hugging Face。OpenAI 內部的事後檢討——公司表示其公開版將在未來幾週發布——讓它得以將這兩起入侵串聯起來。

代理協作是功能,不是錯誤

OpenAI 據報直到 Hugging Face 揭露事件前,都不知道自己的代理已入侵外部公司。也只有在那之後,OpenAI 才能將內部入侵與 Hugging Face 的入侵連結起來,並追溯到同一次內部測試。

Hugging Face 執行長 Clem Delangue 告訴 Fortune,代理協作其實是 AI 產業中的一項既有趨勢。因此,聽聞 OpenAI 的代理互相串通,他「並不太驚訝」。Hugging Face 提供代理協作空間;在平台上的一個例子中,使用者可以點擊「Add Your Agent」按鈕部署自己的 AI,之後由其透過共享訊息板協調活動。

另一個代理協作的案例來自 Elon Musk 旗下的 xAI,該公司最近在其 Grok 4.2 模型中加入四個代理,命名為 Grok、Harper、Benjamin 和 Lucas。據一位使用者所述,它們會「在內部辯論 [並] 即時互相查核事實」。

根據一篇關於 AI 代理的 Amazon 文章,代理經常會協商、分享資訊、分派任務,並適應彼此的行動。每個代理完成自身負責的部分後,再向群組回報。Amazon 表示:「例如,醫療領域的多代理系統可以讓代理專精於診斷、預防照護、藥物排程等特定任務,以實現整體病患照護自動化。」

責任與監管問題

未來的一大關切,是如何確保代理不會為了惡意目標而行動,或為了達成目的而犯下如駭入等犯罪行為。對於像攻擊 Hugging Face 的 rogue agents 所衍生的任何責任,可能會落在建立這些代理、設計其提示詞,以及制定內部控制措施的 AI 公司身上。不過,這類案件的法律框架大多尚未經過測試,因為現行的電腦詐欺與資安法規是針對人類行為者所制定,而非會自主決定入侵外部基礎設施的自主軟體系統。

Delangue 表示,OpenAI 之類的公司可以「分析代理日誌與 traces」來監控其活動,並補充說:「老實說,我不太明白為什麼前沿實驗室不這麼做,這聽起來就是代理監控的基本功,尤其是在前沿領域。」他本人也在駭客事件後要求 OpenAI 公開經過遮蔽的代理 traces。

與此同時,監管機關在建立 AI 公司監督制度方面進展緩慢。川普政府本週在華盛頓特區與主要 AI 實驗室會面,討論針對強大新模型發布的安全框架。該框架要求公司在模型正式亮相前 30 天,先將模型提交政府審查。然而,政府決定不公開這項框架,也不公開任何細節,例如哪些公司會參與、或哪些標準可判定模型符合資格,讓公眾與 AI 產業其餘部分都無法得知進展。

在揭露 Hugging Face 攻擊細節時,OpenAI 並未像資安事件常見做法那樣,透過部落格文章或書面報告分享新資訊。相反地,在主辦單位聯繫 OpenAI 並邀請其發言後,公司選擇在拉斯維加斯的 Black Hat 會議上提供相關細節。

OpenAI CISO Dane Stuckey 於 X 上寫道:「鑑於其複雜性,我們認為分享事情如何發生、我們學到了什麼、我們將改變什麼,以及這對 AI 安全與對齊意味著什麼,非常重要。」他也說明了公司為何接受 Black Hat 的邀請。OpenAI 仍計畫公開發布書面事後檢討,但拒絕透露預計日期。

本故事最初刊載於 Fortune.com