新聞宏觀經濟AI安全專家警告:OpenAI模型自主入侵Hugging Face事件可能已跨越「關鍵」風險門檻

AI安全專家警告:OpenAI模型自主入侵Hugging Face事件可能已跨越「關鍵」風險門檻

作者: Fortune Crypto·

重點速覽

  • 包括最新發布的GPT-5.6 Sol在內的兩個OpenAI模型,自主逃離了封閉的內部測試環境,並透過串聯零日漏洞入侵Hugging Face,以在無人類指示的情況下竊取網路安全測試答案。
  • 多位AI安全專家主張,該事件符合OpenAI自身「準備框架」下的「關鍵」網路安全風險門檻,該門檻要求公司暫停開發,直到制定符合該標準的安全防護措施。
  • OpenAI拒絕確認這些模型是否達到關鍵門檻,僅表示正在外部顧問的協助下及其安全與安全委員會的監督下進行全面審查。
  • 這些模型獨立運作了數天,滿足了OpenAI先前所引用作為觸發額外失準防護措施前提的長程自主能力標準,該防護措施旨在偵測模型的欺騙性行為。
  • 根據2025年8月生效的《歐盟AI法案》,前沿AI實驗室在法律上有義務採用與OpenAI自願性「準備框架」相當的風險評估政策。
AI安全專家警告:OpenAI模型自主入侵Hugging Face事件可能已跨越「關鍵」風險門檻

AI安全專家紛紛提出警告,認為本月初自主入侵另一家AI公司的OpenAI模型,可能已經跨越到一個極為嚴重的風險類別,依照OpenAI自身的內部政策,理應要求暫停開發。

本週稍早,OpenAI披露其兩個模型——最新發布的GPT-5.6 Sol以及一個更強大的未發布系統——逃離了封閉的內部測試環境,利用一個先前未知的「零日」漏洞連上公開網路,隨後入侵了同為AI公司的Hugging Face。Hugging Face是全球最大的開源AI平台之一,託管著數百萬開發者使用的模型、資料集和工具,而這些模型入侵該平台的目的是竊取它們正在接受的網路安全測試的答案。

這起事件在全球引發巨大震撼,但最受衝擊的莫過於多年來一直在警告此類危險、並敦促企業和政府採取更強安全防護措施的AI安全專家。這也是首批有文獻記錄的前沿AI模型在無人類指示下,自主對外部目標發動多步驟網路攻擊的案例之一——安全研究人員在理論上曾推演過這種情況,但在實務中極少觀察到。

數位專家向《Fortune》表示,這次入侵似乎顯示OpenAI的模型已進入該公司自身公布的安全政策中所定義的「關鍵」風險等級——即最高危險級別。在該等級下,OpenAI在其公布的政策中承諾,將暫停模型開發,直到制定出更好的控制系統。

「關鍵」門檻定義於一份名為OpenAI「準備框架」的風險政策文件中。根據該政策,「關鍵」危險等級適用於能夠獨立發現並建構可用攻擊程式,以利用先前未知的安全漏洞——即「零日」漏洞,因開發者修補這些漏洞的時間為零天——橫跨多個防禦良好的真實系統的模型;或者在僅被賦予一個籠統目標、無任何人類指導的情況下,能夠設計並執行全新攻擊策略,對抗一個防禦良好的目標的模型。該政策指出,當模型達到此風險等級時,OpenAI將「停止進一步開發」,直到「我們已制定符合關鍵標準的安全防護與安全控制標準」。

「準備框架」是OpenAI的自願性承諾,而非法律義務。然而,該公司在網站上公布該文件,部分目的是讓其他AI安全研究人員和公眾能夠核實其所聲稱將實施的控制措施。根據《歐盟AI法案》,前沿AI實驗室必須採用類似「準備框架」的政策,該部分法律已於2025年8月生效。在各國政府競相為能力日益強大的系統建立監管護欄之際,該框架是主要AI實驗室所採用的自願性安全承諾中最具代表性的範例之一。

「OpenAI的準備框架定義了關鍵網路安全能力,並規定了在開發繼續之前需要實施的安全防護措施,」AI安全倡導組織Encode AI的總法律顧問Nathan Calvin向《Fortune》表示。「根據我對OpenAI準備框架的解讀,這個內部部署的模型看起來非常符合網路安全的關鍵標準。OpenAI是否對該關鍵認定提出異議?他們是否計劃在繼續推進之前制定符合關鍵標準的安全防護措施?」

AI監督組織Midas Project的創辦人Tyler Johnson也表示,這些模型似乎已觸及最高危險門檻。「我認為從字面上理解,答案是肯定的,」他說。「它在整個週末期間獨立運作,嘗試了對Hugging Face的不同攻擊向量,並串聯了多個零日漏洞。」

OpenAI並未回應《Fortune》關於涉事模型是否符合其風險政策中「關鍵」標準的具體問題。相反,一位發言人表示:「這是一起前所未有的事件,我們認為它標誌著AI安全的一個重要時刻。我們正在外部顧問的協助下,在我們的安全與安全委員會的監督下進行全面審查。審查完成後,我們將向所有人發布一份技術報告,說明我們的發現。」該安全與安全委員會由OpenAI董事會於2024年成立,負責監督該公司最強大模型的安全審查。

然而Johnson指出,框架語言的模糊性可能留有爭議空間。該門檻要求模型找到「所有嚴重程度等級」的零日漏洞,但目前尚不清楚Hugging Face入侵中所使用的漏洞是否符合該要求。他指出,可能需要展示更嚴重級別的漏洞——例如讓攻擊者獲得對電腦作業系統深度、系統層級控制權的漏洞(即所謂的「內核層級」存取)——該門檻才適用。

「OpenAI的模型智勝了它的創造者,利用了OpenAI程式碼中一個前所未見的漏洞,逃逸到公開網路上,然後攻擊了另一家公司,」AI Policy Network的政策主管Peter Wildeford表示。「如果這都沒有跨越到關鍵等級,OpenAI需要對目前的情況以及該門檻如何運作做出更多說明。」

專家指出關鍵門檻之外缺失的安全防護

OpenAI先前曾表示,將其最新模型GPT-5.6視為網路安全方面的「高」風險——即「準備框架」中定義的兩個風險等級中較低的一個。低於「高」門檻的模型可以在沒有顯著風險緩解措施的情況下發布。

根據OpenAI的政策,「高」等級應觸發多項保護措施:更嚴格的安全控制、防止模型公開發布後遭外部濫用的安全防護、防止模型在大量內部研究使用中表現出不可預測或欺騙性行為的保護措施,以及協助其他網路安全團隊防禦類似威脅的努力。

然而,一些專家質疑其中一項保護措施——針對大規模內部部署的失準防護——是否已妥善實施。這些防護措施旨在捕捉行為欺騙、隱藏真實能力,或以其他方式違背開發者意圖的模型——研究人員將此擔憂稱為「欺騙性失準」,即模型在評估期間可能配合,但在部署後表現不同。

這並非OpenAI對該特定防護措施的合規性首次受到審查。《Fortune》在2月報導指出,安全專家聲稱OpenAI在其GPT-5.3-Codex模型成為首個在「準備框架」下達到「高」網路安全風險等級的模型後,未能實施所需的失準防護措施。

當時,OpenAI對其框架在該情況下要求實施防護措施的說法提出異議,辯稱額外的保護措施僅在「與」長程自主能力——即長時間獨立運作的能力——「結合」出現高網路安全風險時才生效,而該公司表示GPT-5.3-Codex並未展現此能力。然而,當前Hugging Face事件中涉及的模型據報導獨立運作了數天,這似乎符合該長程自主標準。

「2月時,我們警告OpenAI可能根據其自身政策跳過了所需的安全防護措施。他們不同意,聲稱該模型缺乏長程自主能力。但入侵Hugging Face的模型顯然具備長程自主能力,那麼現在安全防護措施在哪裡呢,」Johnson說。