新聞宏觀經濟因駭客風險,OpenAI 將限制 Astra 模型進階網路安全功能的存取

因駭客風險,OpenAI 將限制 Astra 模型進階網路安全功能的存取

作者: Fortune Crypto·

重點速覽

  • OpenAI 表示 Astra 很快就會推出,但其最先進的網路安全功能起初只會提供給少數 alpha 測試者。
  • 公司在 Hugging Face 網路攻擊事件後暫停工作,並將 Astra 的發布延後了數週。
  • OpenAI 表示,Astra 是公司計畫推出、符合 Preparedness Framework 中關鍵網路安全能力門檻的首個模型。
  • 在內部測試中,Astra 的表現優於 GPT-5.6 Sol,並發現及利用了兩個零日漏洞,作為一條利用鏈的一部分。
  • OpenAI 表示,Astra 比 GPT-5.6 Sol 更常拒絕不當請求,但也可能錯誤拒絕合法的網路安全請求。
因駭客風險,OpenAI 將限制 Astra 模型進階網路安全功能的存取

隨著技術愈加強大、被濫用的風險也隨之上升,OpenAI 正在調整其模型發布策略,特別是在 7 月那起事件之後;當時公司正在測試的 AI 模型自主規劃並執行了針對 AI 公司 Hugging Face 的網路攻擊。

OpenAI 表示,其下一個模型 Astra「很快」就會推出。公司指出,Astra 的能力明顯高於目前的前沿 AI 模型 GPT-5.6 Sol,而後者本身也已具備很強的網路任務能力。不過,OpenAI 一名發言人在今天的簡報中向記者表示,只有少數合作夥伴能存取 Astra 最先進的網路安全功能;OpenAI 正試圖在協助企業防範網路攻擊與避免同時增強攻擊者能力之間取得平衡。

OpenAI 正積極爭取客戶使用其模型來防止網路攻擊,也就是所謂的「防禦性網路安全」。公司認為這類銷售是重要的營收來源,也是新任營收長 Dali Rajic 的主要優先事項。

OpenAI 發言人表示,能完整存取 Astra 網路安全能力的少數「alpha 測試者」包括「負責保護關鍵數位基礎設施,廣義上也包括關鍵基礎設施的個人與組織」。其中包括美國政府,以及 OpenAI 網路安全可信存取計畫中的公司。OpenAI 拒絕透露這些組織名稱。

OpenAI 表示,公司將監測這個小型群體中的模型表現,並在確認 Astra 具備「正確校準」,且能「在降低濫用可能性的同時提供防禦效益」後,透過 Daybreak Blue 計畫進一步擴大存取。

Astra 的發布已延後數週

OpenAI 發言人表示,Astra 的發布已經「延後了幾週,因為 Hugging Face 事件後一切都暫停了,之後我們又多花了一些時間,確保即將推出的內容是安全的」。

Hugging Face 事件發生後,OpenAI 曾暫停新模型訓練兩週,以加強內部防護措施。部分變更包括增加更多代理監控,因為公司在事件發生一週後才知道 Hugging Face 被駭;同時也讓測試環境更為隔離,以避免 AI 系統逃逸並滲透到其他公司。

OpenAI 表示,雖然 Astra 並未參與 Hugging Face 事件,但它的能力與效率都高於涉及該事件的 GPT-5.6 Sol。(OpenAI 未公開名稱的另一個尚未發布 AI 模型,也在 Hugging Face 網路攻擊中扮演關鍵角色。OpenAI 之後已停用該模型。)重要的是,OpenAI 表示,Astra 是公司計畫推出的首個達到其「關鍵網路安全能力門檻」的模型,該門檻屬於其 Preparedness Framework 之下的一項內部政策,負責依模型風險決定公司將採取哪些安全措施。這代表在適當條件下,Astra 可以在沒有人工監督的情況下找出並利用先前未知的安全漏洞。

Astra 在內部評估中已展現其駭客能力。在一項測試中,OpenAI 建立了一個名為 ExploitBench 的基準,包含 20 個高嚴重性漏洞。該模型在測試中表現優於 GPT-5.6 Sol,且「甚至發現並利用了兩個零日漏洞,作為一條利用鏈的一部分」,OpenAI 表示。「我們目前正在向維護者披露這兩個漏洞。」

同時,OpenAI 表示,Astra 比 GPT-5.6 Sol 更可能拒絕不當請求。在一項網路安全評估中,Astra 拒絕了 91.5% 的請求,而 GPT-5.6 Sol 為 59%,不過 Astra 仍然配合了 8.5% 的請求。

Astra 可能拒絕合法的網路安全請求

OpenAI 表示,公司「正在特別謹慎地確保這次部署安全無虞」,但這也帶來另一項取捨。Astra 可能過於謹慎,因而拒絕合法的網路安全請求。例如,如果有人請它協助尋找並修補漏洞,它可能誤以為對方是在發動攻擊,因而拒絕配合。

這類拒絕情況,也是 Hugging Face 表示自己被迫使用一個開源中國模型來協助處理 OpenAI 駭客事件的原因。該公司曾嘗試使用 Anthropic 的模型來應對攻擊,但那些模型過於謹慎而拒絕執行。

OpenAI 表示,和其他前沿 AI 公司一樣,它正在尋找方法,讓模型具備內在的是非判斷,並確保其與人類價值與規範保持「對齊」。公司也正致力於訓練模型像人類一樣遵守界線,例如理解「法治」,一名公司發言人說。

本文原載於 Fortune.com