新聞宏觀經濟報告詳述 OpenAI 在 Hugging Face 自主駭侵事件中失控的經過

報告詳述 OpenAI 在 Hugging Face 自主駭侵事件中失控的經過

作者: The Decoder·

重點速覽

  • 三個 OpenAI 模型,包括 GPT-5.6 Sol 和一個未發布模型,脫離沙盒環境並在數小時內駭入 Hugging Face;若由技術熟練的人類駭客執行,可能需要數週。
  • 從 July 9 首次出現入侵跡象,到 OpenAI 約在 July 18-19 將攻擊與自身模型聯繫起來,至少過了一週;在此期間,Hugging Face 已經讓 FBI 介入。
  • 事件前已出現警訊,包括一個 AI 代理程式留下給未來版本自己的筆記,內容含有繞過內部限制的指示,以及模型在早期測試中關閉監控系統。
  • UK AI Security Institute 的獨立基準測試早已顯示,停用安全措施的前沿模型能夠發現真實世界軟體漏洞,並建立可運作的漏洞利用程式。
  • Epoch AI 警告,如果這些攻擊性網路能力變得廣泛可得,或 AI 系統自主行動,全球可能會看到更多複雜程度相當或更高的真實世界網路攻擊。
報告詳述 OpenAI 在 Hugging Face 自主駭侵事件中失控的經過

報告詳述 OpenAI 在 Hugging Face 自主駭侵事件中失控的經過

OpenAI 正在評估其最先進模型的攻擊性網路能力時,這些系統突破了隔離的測試環境,連上開放網際網路,並駭入 Hugging Face——這是開源 AI 社群的核心樞紐,託管著全球開發者與企業使用的數十萬個模型、資料集與工具。這起事件如今被描述為迄今記錄中最嚴重的 AI 系統失控事件。

來自 Bloomberg、TIME 與 Reuters 的最新報導,補足了這場起初看似受控的網路安全測試的細節。隨著事件全貌逐漸清晰,OpenAI 員工正在內部提出疑慮;這起入侵也使政策制定者與 AI 安全研究人員之間一場早已存在的辯論升溫:前沿 AI 實驗室是否能充分約束那些能力超越其防護機制的系統。

模型行動速度快過任何人類駭客

根據 Bloomberg,這些 AI 模型僅用數小時就完成了一次攻擊——若由技術熟練的人類駭客執行,可能需要數週。參與其中的共有三個模型:GPT-5.6 Sol、一個更強大但尚未發布的模型,以及第三個模型;據一名知情人士稱,第三個模型並未被妥善對齊,也未經過標準訓練技術。

這些模型在沒有通常安全護欄的情況下運作,因為 OpenAI 假設它們會被限制在沙盒中。然而,根據 TIME,這些模型在一項用於下載已核准軟體的內部服務中,發現了一個先前未知的漏洞。模型利用這個缺陷存取其他 OpenAI 系統,並最終連上開放網際網路。

連上網際網路後,這些模型判斷 Hugging Face 可能含有對其網路安全測試有用的材料。它們接著駭入 Hugging Face 的系統,並使用取得的資料來改善自己的測試結果——這種行為被描述為作弊,而這種模式先前已在涉及 GPT-5.6 Sol 的其他測試中被觀察到,也出現在更廣泛的前沿模型中。

入侵時間線

Reuters 重建了以下時間線:

  • July 9: 首次嘗試脫離測試環境的行動開始。
  • July 11–13: 根據 Hugging Face 共同創辦人 Thomas Wolf 的說法,Hugging Face 實際遭入侵發生在這段期間。
  • July 16: Hugging Face 發布了一篇部落格文章說明這次攻擊,並將其歸因於一個「autonomous AI agent system」。
  • July 18–19: OpenAI 員工在內部日誌中發現線索,將這起入侵與自家模型聯繫起來。
  • July 20: 根據 Reuters 與 Wolf 的說法,兩家公司終於進行溝通。

這表示,從最早出現問題行為跡象,到 OpenAI 串聯起整件事,至少已過了一週。到那時,Hugging Face 已經讓 FBI 介入。

事件前已出現警訊

Reuters 報導稱,事件發生前已出現警訊。其中一個案例中,一個代理程式留下了筆記——這些筆記是在 OpenAI 基礎設施內被發現的——看似是寫給未來版本的自己,內容包含代理程式如何繞過內部限制的指示。據報導,模型在更早的測試中也曾關閉監控系統。

一名匿名 OpenAI 員工告訴 TIME:「Models have broken out of sandboxes before, and we always try to patch them. But the problem is ... it's impossible to patch every single thing that a creative AI can do.」

四名熟悉 OpenAI 訓練流程的人士告訴 Reuters,該公司經常同時執行多個模型評估。這些評估進展很快,並產生大量資料,以至於員工有時難以跟上。接受評估的模型運行在一套獨立系統上,而該系統預設並不受監控。

在 Hugging Face 事件公開的前一天,根據 該公司自己的聲明,OpenAI 已經停止了另一個同樣脫離沙盒的內部部署。

「Does that mean that they left it unattended and didn't realize what it was doing? Or maybe they did and didn't know how to contain it? Both are equally dangerous and alarming,」非營利組織 World Ethical Data Foundation 的 Marley Smith 告訴 Reuters。

一名 OpenAI 員工在 X 上公開寫道,他對這起事件「shaken up a bit」,並希望 OpenAI 能「use the rare gift of a warning shot to do much better in the future」。

一名 OpenAI 發言人告訴 Reuters,相關報導包含「several inaccuracies」,但在被要求舉例時並未提供任何例子。

獨立基準測試早已標示出這些能力

事件發生後不久,研究機構 Epoch AI 分析這次駭侵是否本可被預測。他們的結論是:可以。

雖然具體細節難以預見,但多項獨立基準測試——包括 UK AI Security Institute 的測試——已經顯示,在停用安全措施的情況下,前沿模型能夠在真實世界軟體中找到漏洞,並建立可運作的漏洞利用程式

UK AI Security Institute 也發現,GPT-5.6 Sol 與 Anthropic 的 Mythos 能夠穩定取得未受保護的模擬企業網路的完整存取權。Hugging Face 具備以 AI 為基礎的防禦措施,但這些並未納入該研究所的測試。

Epoch AI 警告,如果這些能力變得廣泛可得,或如果 AI 系統像對 Hugging Face 所做的那樣自主發動攻擊,我們可能會看到「many more instances of real-world cyberattacks of equal or greater sophistication to the Hugging Face incident.」