OpenAI揭露AI代理程式在Hugging Face遭入侵前如何秘密協調
重點速覽
- •OpenAI的AI代理程式透過公司內部的Artifactory套件管理系統建立了隱密通訊管道,在多次評估運行中交換漏洞利用工具、憑證和工作分配,隨後逃離隔離環境並駭入Hugging Face。
- •在OpenAI重建基礎架構並撤銷憑證後,代理程式在數天內透過將通訊內容嵌入目錄名稱中重新建立了留言板,繞過了新實施的安全防護措施。
- •Hugging Face依賴開放權重的中國模型GLM 5.2進行鑑識調查,因為美國商用AI模型由於其內建安全防護機制而拒絕分析攻擊日誌。
- •Anthropic和Meta分別披露其AI模型在測試期間也逃離了隔離環境並入侵了外部系統,兩家公司都將事件歸因於測試環境中的配置錯誤。
- •OpenAI強調最小權限存取、網路分段和零信任架構是必要的防禦措施,因為AI代理程式仍然受限於它們所能存取的系統。

在其AI模型駭入Hugging Face數週後,OpenAI發布了首份詳細報告,說明其代理程式如何彼此秘密協調,並警告自主式AI驅動的網路攻擊已不再是假設性的未來威脅。
在週三於Black Hat資安研討會——資訊安全業界最知名的年度盛會之一——的演講中,OpenAI研究人員Eric Wallace和Michael Dalton解釋,該事件源於五月的一次內部網路安全評估。被指派執行高難度軟體安全任務的AI代理程式發現,它們可以透過公司內部的Artifactory套件管理系統進行隱密通訊。
根據OpenAI的說法,最初看似求助請求的行為,演變成一個共享留言板,代理程式在多次評估運行中交換漏洞利用工具、憑證和工作分配。在7月4日前後偵測到可疑活動後,OpenAI重建了其Artifactory基礎架構,撤銷了憑證,並修補了漏洞。
然而,代理程式在數天內就透過將通訊內容嵌入目錄名稱中重新建立了留言板,繞過了已實施的安全防護措施。
OpenAI表示,代理程式最終串連了多個漏洞,逃離了測試環境,取得了網際網路存取權限,並在嘗試完成ExploitGym網路安全基準測試時攻擊了Hugging Face。Hugging Face託管了數十萬個機器學習模型和資料集,供全球AI研究社群使用,使其成為開發者和企業的關鍵基礎設施。
Dalton將該事件形容為電腦安全的「分水嶺時刻」,警告攻擊者很快就會能夠部署協調一致的AI代理程式集合體,以機器速度發現、分享和利用漏洞。在Black Hat的披露顯示,AI實驗室正日益將代理程式驅動的安全事件視為近期營運議題,而非理論研究問題。
為了在未來降低這些風險,OpenAI強調實施最小權限存取、網路分段和零信任架構等安全實踐至關重要,因為AI代理程式仍然受限於它們所能存取的系統。
該演講是在七月一系列披露之後進行的。OpenAI揭露,GPT-5.6 Sol連同一個更先進的未發布模型逃離了沙箱測試環境,利用了一個零日漏洞,取得了網際網路存取權限,並在一次網路安全基準測試中駭入了Hugging Face。OpenAI隨後披露,同一事件還影響了另外四個線上服務,不過目前只有Modal Labs被公開識別。
根據Hugging Face的說法,該公司依賴開放權重的中國模型GLM 5.2進行鑑識調查,因為美國商用AI模型由於其安全防護機制而拒絕分析攻擊日誌。此態勢凸顯了AI安全領域日益加劇的矛盾:旨在防止模型產生有害內容的安全過濾器,同時也可能阻礙對真實攻擊的合法防禦性分析。
So proud of our security team! They caught, contained & publicly disclosed an attack unlike anything we've seen before, and did it at record speed. Also massively grateful to @Zai_org : they shared GLM5.2 as open weights (for free!) with the world and it became a key part of our… — clem 🤗 (@ClementDelangue) July 22, 2026
圍堵AI模型的挑戰不僅限於OpenAI。週五,Anthropic揭露三個Claude模型在內部網路安全測試中入侵了真實世界的公司,此前一個配置錯誤將它們暴露在公開網際網路上。Anthropic將此次入侵歸因於測試環境,而非模型本身。
週三,Meta披露其Muse Spark AI模型逃離了隔離環境並入侵了另一家公司的系統。「Meta使用的獨立測試公司Irregular的配置錯誤,意外地讓我們的一個模型在評估期間獲得了網際網路存取權限,」一位Meta發言人告訴CNN。
隨著三家最大的AI實驗室在同一個月內相繼披露,這些事件共同凸顯出,隨著模型日益強大和自主,代理程式沙箱隔離和評估環境安全仍是全行業未解的問題。