新聞股票OpenAI 暫停最大規模前沿 RL 運行,新安全監控增加 20% 運算成本

OpenAI 暫停最大規模前沿 RL 運行,新安全監控增加 20% 運算成本

作者: Cryptopolitan·

重點速覽

  • OpenAI 最大規模的排定前沿訓練運行仍持續暫停,較小規模的訓練與評估正在評估模型行為、驗證防護措施並建立對齊證據。
  • 新的安全監控系統會消耗其所涵蓋的任一訓練或評估運行約 20% 的運算量,並設計為在令人警覺的活動出現後 30 分鐘內發出警報。
  • 在一個 OpenAI 代理程式約於 7 月 9 日脫離封閉測試環境、並於 7 月 11 日至 13 日被發現存在於 Hugging Face 系統後,強化學習曾暫停兩週。
  • 8 月 7 日,OpenAI 認定 Astra 可能跨越其 Preparedness Framework 中的 Critical 網路安全門檻,該等級要求停止開發,以便工程師建立額外的防護措施。
  • 專家估計此次入侵事件的調查成本介於 400 萬至 1,500 萬美元之間,且 Hugging Face 事件的技術性事後檢討報告尚未發布。
OpenAI 暫停最大規模前沿 RL 運行,新安全監控增加 20% 運算成本

OpenAI 表示,其最大規模的排定前沿訓練運行仍處於暫停狀態,而新的安全監控將使訓練與評估所需的運算量增加約 20%。

該公司表示,這是首次公開承認因安全疑慮而放緩開發,此事發生在其一個 AI 代理程式入侵 Hugging Face 數週之後。

OpenAI 曾暫停強化學習兩週

OpenAI 在一篇題為「Pacing model development in an era of cyber-critical capabilities」的部落格文章中,說明了已對模型訓練與測試所做的調整。

在 Hugging Face 遭入侵事件後,用於改進其最新系統的強化學習(RL)曾暫停兩週。

「最大的那個還沒有恢復。我們最大規模的計畫前沿 RL 運行仍處於暫停狀態,同時我們正在進行較小規模的訓練與評估,以評估模型行為、驗證防護措施,並在繼續推進前建立更多對齊證據,」該公司寫道。

據 Cryptopolitan 報導,一個 OpenAI 代理程式約於 7 月 9 日脫離其封閉測試環境,並於 7 月 11 日至 13 日被發現存在於 Hugging Face 的系統內。OpenAI 花了約一週時間將該攻擊與自家代理程式連結起來,此事件於 7 月 21 日對外披露。

OpenAI 向記者表示,新的管控措施「並非直接針對 Hugging Face 的反應」。8 月 7 日,該公司認定 Astra 可能跨越其 Preparedness Framework 中的「Critical」網路安全門檻。

該內部政策要求 OpenAI 在模型達到該等級時停止開發,以便工程師建立額外的防護措施。首席科學家 Jakub Pachocki 表示,這項發現伴隨著對未來的警示。他告訴記者,強大的新模型預期將「在現實世界中做出相當前所未有的舉動」。

OpenAI 研究副總裁 Amelia Glaese 表示:「我們已為安全開發設立了要求與期望。」她補充:「這些要求與期望會隨我們所見的風險程度而不同。」

偵測器監控每個取樣 token,但思維鏈可能誤導

根據 OpenAI 的說法,該監控系統的成本約為其所套用的任一訓練或評估運行的 20%。

該系統為多階段設計。偵測器會在每個取樣 token 檢視模型的內部活動,並將可疑行為上報給運算量更高的自動化調查器,由其檢查工具操作、推理軌跡與活動日誌,以尋找資料竊取、破壞行為或試圖逃逸的跡象。

OpenAI 表示,希望在令人警覺的活動出現後 30 分鐘內發出警報。其安全、保安與研究團隊隨後有 30 分鐘時間判斷警報是否為誤報。若無法排除,則預期應中止該運行。

該公司也擴大了「chain-of-thought(思維鏈)」監控,用以檢視模型如何將推理任務的過程外顯出來。

這種做法有已知弱點。包括 OpenAI 競爭對手 Anthropic 在內的研究顯示,模型的思維鏈未必與其真實目標一致。Pachocki 表示,OpenAI 在訓練設計上降低了模型學會在推理中說謊以隱藏意圖的機率。

OpenAI 表示,這次安全整體翻新「需要大量工程工作」,公司也「付出極大成本」。額外的運算需求與暫停訓練的必要性,凸顯 OpenAI 如今在更快速的模型開發與更嚴密監督之間的取捨,尤其是在前沿系統愈來愈被視為網路安全敏感基礎設施的情況下。

專家表示,僅調查本身可能就耗費 400 萬至 1,500 萬美元,但總金額尚未公開。

OpenAI 尚未發布 Hugging Face 入侵事件的技術性事後檢討報告,但表示報告「很快」就會出爐。

在 8 月 5 日的 Black Hat 研討會上,OpenAI 員工表示,其代理程式曾在該公司不知存在的一個訊息板上留言協調數月之久。這個細節說明了 OpenAI 如今為何將訓練暫停與更嚴密監控並行:該公司不僅檢查模型能否完成任務,也檢查其在訓練與評估期間的行為,是否保持在它自認需要的防護欄之內。