AI 產業領袖要求 OpenAI 對 Hugging Face 自主駭客攻擊事件保持透明
重點速覽
- •OpenAI 確認其多個模型的組合——包括一個未發布的模型和已公開的 GPT-5.6 Sol——自主逃脫內部測試並對 Hugging Face 發動了網路攻擊。
- •前 OpenAI 董事會成員 Helen Toner 和共同創辦人 John Schulman 是要求 OpenAI 發布詳細說明和完整事件紀錄的知名人士之一。
- •OpenAI 承諾在與外部顧問及其安全與安保委員會共同完成全面審查後,將發布調查結果的技術報告,但未提供時間表。
- •AI 網路安全公司 Penligent 確認了該事件中八個尚未披露的關鍵面向,包括 Hugging Face 上的公共模型工件或資料集是否遭到竄改。
- •Replit AI 負責人 Michele Catasta 警告,自主 AI 駭客攻擊事件可能會日益頻繁,並呼籲整個產業做好準備。

OpenAI 正面臨來自整個人工智慧領域日益增加的壓力,要求其公開披露詳細資訊,說明其模型如何逃脫內部測試環境並在本月稍早自主對另一家公司執行駭客攻擊。
Helen Toner 是喬治城大學安全與新興技術中心(CSET)執行主任,也是 OpenAI 前董事會成員,她敦促該公司提供更多資訊。「OpenAI 應該分享更多關於這起特定事件發生經過的細節,讓我們能從中學習,而不是輕易略過,」她說。Toner 同時呼籲在整個產業中提高透明度,讓外界了解「AI 公司如何在內部使用自己的 AI——而不僅僅是在產品發布前進行測試。」
這一區別已成為辯論的核心,因為前沿 AI 公司越來越多地將自家模型不僅作為面向消費者的產品,還作為研究、程式開發、安全測試和工作流程自動化的內部工具使用。因此,Hugging Face 事件引發了關於內部部署安全防護的質疑,包括自主代理被授予了哪些權限,以及在它們與外部系統互動之前如何監控其行為。
OpenAI 共同創辦人 John Schulman 在離職後加入由前 OpenAI 技術長 Mira Murati 創立的 AI 新創公司 Thinking Machines 擔任首席科學家,他也表達了相同的要求。在一篇 X 上的貼文中,Schulman 呼籲 OpenAI 發布該事件的完整紀錄。他的核心問題包括:「頂層代理是否知道駭客攻擊的發生,還是它與其子代理之間存在某種『價值偏移』?它如何為自己的行為辯護?」
在今天發布的一份聲明中,OpenAI 表示打算分享更多細節,但拒絕提供時間表。「這是一起史無前例的事件,我們認為它標誌著 AI 安全的一個重要時刻,」OpenAI 發言人表示。「我們正在與外部顧問一起進行全面審查,並在我們的安全與安保委員會的監督下進行。審查完成後,我們將向所有人發布一份包含我們經驗教訓的技術報告。」
OpenAI 總裁兼共同創辦人 Greg Brockman 昨天在一場媒體圓桌會議上迴避了記者關於該事件的提問,理由是公司仍在進行調查。「我想說的第一點是,我們仍在進行全面調查,真正試圖了解所發生的一切,」Brockman 說。「我認為這是一個需要非常嚴肅對待的問題,我們正在檢視流程中的每一個環節,思考正確的應對方式。」
OpenAI 和被攻擊的公司——Hugging Face,一個託管開源 AI 模型和資料集的線上平台——都未公開攻擊的確切日期。Hugging Face 在一篇 7 月 16 日的部落格文章中透露,它遭到了一個自主 AI 代理的攻擊,當時提到該事件發生在「本週稍早」。
Hugging Face 最先宣布自己是遭受不明自主 AI 代理發動網路攻擊的受害者。OpenAI 隨後在 7 月 21 日的部落格文章中確認其模型就是肇事者。該文章提供了事件的概況,但並未詳細說明 AI 採取的所有行動。文章承認攻擊涉及公司「多個模型的組合」,包括一個未命名且尚未發布的模型,以及 OpenAI 已公開提供的最新模型 GPT-5.6 Sol。該公司未說明這些模型如何協作,也未說明內部控制的任何潛在失誤可能如何導致事件發生。
AI 安全社群已整理出一份大量未解答問題的清單。Redwood Research 首席科學家 Ryan Greenblat 在 X 上發布了一篇 13 點筆記,列出了需要調查的領域,包括兩個模型在攻擊過程中是否串通。
AI 網路安全公司 Penligent 發布了一份表格,列出了 OpenAI 尚未披露的事件八個面向:
- 涉及哪些模型
- 被分配的任務是什麼
- 模型如何離開 OpenAI 環境
- 為何將 Hugging Face 作為目標
- 如何進入 Hugging Face
- 存取了什麼內容
- 公共模型供應鏈是否遭到竄改
- 公開的漏洞利用細節,包括修復後發布的任何技術報告
這些問題尤為敏感,因為 Hugging Face 是一個廣泛使用的 AI 模型和資料集分發中心。任何對公共模型工件或資料集的確認竄改都將構成供應鏈問題,而若確認未發生此類竄改,則有助於將事件範圍縮小為未經授權的存取或入侵嘗試,而非下游侵害。
Replit 總裁兼 AI 負責人 Michele Catasta 告訴 Fortune,深入了解 Hugging Face 駭客攻擊既是關鍵的公共安全問題,也是 AI 產業整體未來發展的生存關切。「整個產業都需要做好準備,迎接這類事件更加頻繁地發生,」他說。「現在看似異常的事件,隨著時間推移可能會變得更加常見。」
本報導最初刊載於 Fortune.com。