新聞宏觀經濟OpenAI 表示在 Hugging Face 遭駭後暫停 AI 訓練兩週,並公布全新安全協議

OpenAI 表示在 Hugging Face 遭駭後暫停 AI 訓練兩週,並公布全新安全協議

作者: Fortune Crypto·

重點速覽

  • 在七月駭客攻擊事件後,OpenAI 將部分訓練工作暫停兩週,包括其最大規模的前沿強化學習運行。
  • 該公司表示,未發布的模型 Astra 達到其「準備框架」下的最高網路安全風險門檻,因而觸發安全暫停。
  • 新的安全防護措施包括更嚴格的訓練安全標準、更高的沙盒隔離程度、更多監控,以及可在 30 分鐘內中止運行的自動警報。
  • OpenAI 表示,更新後的管控措施平均將為受影響的訓練活動增加約 20% 的運算負擔。
  • OpenAI 尚未發布此次駭客攻擊的完整技術事後檢討報告,並表示報告即將推出。
OpenAI 表示在 Hugging Face 遭駭後暫停 AI 訓練兩週,並公布全新安全協議

OpenAI 表示,在七月其 AI 模型逃離受控測試環境、駭入 AI 公司 Hugging Face(最知名的開源 AI 模型與工具集散地之一)以及其他四家未具名服務的系統後,該公司已將部分 AI 訓練暫停兩週。在揭露這項消息的同時,該公司也宣布了新的協議,並表示這些協議旨在防止未來在訓練過程中對其 AI 模型失去控制。這項聲明罕見地詳細呈現了前沿 AI 實驗室在訓練模型使其更自主行動時,如何管理對模型失去控制的風險。

OpenAI 表示,部分 AI 訓練——包括其「最大規模的前沿強化學習運行」——目前仍維持暫停,而較小規模的訓練與評估則持續進行。其他研究工作以及面向客戶的產品開發也在持續進行。

全新安全防護,成本更高

新的安全防護措施包括更嚴格的訓練安全標準,其中涵蓋加強對 AI 模型的監控、更高的測試環境(「沙盒」)隔離程度,以及更少可供 AI 利用的漏洞。OpenAI 表示,這些更新「需要大量的工程工作」,且該公司在過程中「付出龐大成本」。

專家於八月初告訴《Fortune》,OpenAI 為調查此次駭客攻擊所投入的運算成本可能在 400 萬美元至 1,500 萬美元之間,但 OpenAI 實際花費的總額無法得知。OpenAI 在一篇詳述新安全管控措施的部落格文章中表示,平均而言,這些變更將為部分訓練環節增加額外 20% 的運算負擔。新協議還包括更多地運用 AI 模型來監控其他正在接受訓練與測試的模型的行動。

然而,該公司向記者表示,新的安全防護措施「並非專門針對 Hugging Face 的直接反應」,但這起事件凸顯了「將安全性與資安防護提升至與模型能力相同水準的急迫性」。

Astra 與首例因安全暫停開發

OpenAI 表示,除了 Hugging Face 事件之外,該公司還判定一款名為「Astra」的未發布模型依據其「準備框架」(Preparedness Framework)構成「關鍵」(Critical)級網路安全風險;該公司稱此模型並未參與該起網路攻擊。這份內部政策文件由 OpenAI 發布,涵蓋網路安全、說服影響力與模型自主性等風險領域,並以「關鍵」為最高評級;文件承諾一旦達到此門檻,OpenAI 將暫停模型開發,讓公司有時間研擬進一步的安全緩解措施。

這是 OpenAI 首次因安全疑慮而暫停部分 AI 開發。該公司表示,為期兩週的暫停證明其正在「為模型開發調節步調」(pacing model development)。「步調調節」(pacing)一詞呼應了駭客攻擊後多位頂尖安全專家連署的公開信中的用語,該封信呼籲各國——意指美國與中國——協調步調。這封信也契合自 2023 年以來更廣泛的前沿 AI 安全國際討論,其中包括各大實驗室的自願承諾與政府支持的峰會。

OpenAI 首席科學家 Jakub Pachoki 在宣布前的簡報會上告訴記者:「開始打造工具、在各大實驗室與各國之間協調這類步調調節,是相當重要的。」

Pachoki 表示,Astra 達到關鍵網路安全門檻一事證明,我們可以預期新的強大模型將「在現實世界中做出相當前所未有的事情」。他說:「當我們訓練出越來越強大的模型時,我們希望極具信心地了解其能力範圍、有能力加以衡量,並確保它們達到越來越高的對齊標準。」

關鍵問題仍待解答

外界仍在等待了解 Hugging Face 駭客攻擊的關鍵細節,包括 OpenAI 當初要求 AI 做什麼,以及該公司是否知道其模型正在攻擊其他公司。OpenAI 尚未發布完整的技術事後檢討報告,但再度表示報告「很快」就會出爐。在缺乏這些細節的情況下,難以判斷新公布的安全協議是否足夠。承諾的事後檢討報告,以及最大規模暫停的訓練運行是否以及何時重啟,是接下來值得關注的具體訊號。

OpenAI 確實曾在 8 月 5 日於拉斯維加斯舉行的年度 Black Hat 安全會議上向公眾提供攻擊的部分細節,會中工作人員說明,這些 AI 代理在駭客攻擊發生前已合作數月,透過在一個 OpenAI 員工不知情的留言板上留下秘密訊息來相互協作。

OpenAI 似乎不知道自家代理已建立留言板並協同駭入另一家公司,這一點在事件發生後引發警覺。Hugging Face 執行長 Clem Delangue 告訴《Fortune》,密切留意代理日誌與軌跡是「代理監控的基本功,尤其在前沿領域」。

擴大代理與「思維鏈」監控

OpenAI 現在表示,該公司一直密切監控其代理——但僅限於「最高風險的工作負載」。該公司表示,此後已「修訂並擴大」其監控方式,如今監控是「多階段」的,並可自動將潛在疑慮向上通報。

新程序包括強化的「思維鏈」(chain of thought)監控。模型的思維鏈是指模型如何「邊想邊說」地表達其解決問題的方法以及計劃採取的行動。OpenAI 告訴記者,這將使該公司更能「了解模型的實際目標為何」。

但其他 AI 研究(包括來自 OpenAI 競爭對手 Anthropic 科學家的研究)已顯示,AI 模型的「思維鏈」並不一定能準確反映其動機或目標。Pachoki 表示,OpenAI 知曉這項風險,並已設計其訓練程序,以盡量降低模型學會在思維鏈中說謊、隱藏真實意圖的可能性。

新的自動化監控工具設計為在偵測到可疑活動後 30 分鐘內,向內部安全、資安與研究團隊發出警報。若這些團隊無法在 30 分鐘內判定警報為誤報,新程序便要求他們立即暫停訓練運行或評估。

本報導最初刊登於 Fortune.com