新聞宏觀經濟OpenAI 因「關鍵」級網路安全發現暫停部分 Astra 活動;Altman 表示訓練持續進行

OpenAI 因「關鍵」級網路安全發現暫停部分 Astra 活動;Altman 表示訓練持續進行

作者: CryptoBriefing·

重點速覽

  • OpenAI 表示,Astra 的網路安全能力已達到或接近其「準備框架」中的「關鍵」等級。
  • 該模型展現了先進的代理式編碼技能,以及發現或利用零日漏洞的潛力。
  • OpenAI 暫停了受影響的內部活動兩週多一點的時間,期間實施了新的安全措施。
  • Sam Altman 表示,Astra 的核心訓練並未停止,新模型仍預計很快推出。
OpenAI 因「關鍵」級網路安全發現暫停部分 Astra 活動;Altman 表示訓練持續進行

2026 年 8 月 7 日,OpenAI 暫停了與其 Astra 模型相關的部分內部活動,因為初步調查結果顯示,該 AI 已達到該公司歸類為「關鍵」級的網路安全能力。不過,執行長 Sam Altman 強調,Astra 的核心訓練從未停止,新模型仍按計畫即將推出。

是什麼引發了這次暫停

疑慮的核心在於 Astra 的網路安全能力。據報導,該能力已達到或接近 OpenAI「準備框架」中的「關鍵」等級——這是該公司用於評估模型風險的最高分類。

實際上,該模型展現了精密的代理式編碼技能,以及識別或利用零日漏洞的潛力。零日漏洞是指軟體供應商尚不知情的資安缺陷,這使得它們對防禦者和攻擊者而言都極具價值。AI 驅動的漏洞發現早已是活躍的工作領域:DARPA 的 AI 網路挑戰賽於 2025 年在 DEF CON 駭客年會上舉行決賽,要求 AI 系統找出並修復廣泛使用的開源軟體中的缺陷,這突顯了此處涉及的能力在防禦潛力與雙重用途風險上的兩面性。

這次暫停持續了兩週多一點的時間,期間 OpenAI 針對這些特定能力實施了新的安全措施。在這段期間,該公司評估了相關風險,並在恢復受影響的活動之前建立了防護機制。

Astra 更廣泛的能力

網路安全層面只是這個看似極其強大的模型的其中一個面向。據報導,Astra 的早期版本解決了數學與理論電腦科學領域的 10 個重大未解問題——如果此一說法獲得獨立驗證,將是 AI 研究領域的里程碑式成就。

Altman 曾表示,Astra 計畫以「全面開放」的方式提供,這意味著它不會無限期地被限制在僅供研究的封閉存取之後。不過他也承認,還需要更多時間來確保模型能夠安全地開發,並特別聚焦在更大規模推出之前處理其網路安全能力。

安全與速度的權衡

OpenAI 的「準備框架」正是為這類情況而設計。該框架於 2023 年 10 月推出,在網路安全、說服力、自主性以及生物威脅等類別中建立了從「低」到「關鍵」的風險等級。當模型在任何類別中達到關鍵等級時,便會觸發額外的審查與緩解步驟,部署才能繼續進行。

類似的機制如今已遍及前沿實驗室領域:Anthropic 的「負責任擴展政策」與 Google DeepMind 的「前沿安全框架」皆定義了會觸發更嚴格防護措施的能力門檻,使分級風險評估成為新興的業界常規。據報導的 Astra 關鍵等級發現,是迄今為止大型實驗室啟動此類門檻最清晰的公開案例之一。

該框架受到矚目,也延續了 OpenAI 安全治理多事的一段時期。2024 年,該公司在共同負責人 Ilya Sutskever 與 Jan Leike 相繼離職後解散了長期導向的超級對齊團隊,並將其工作併入更廣泛的安全計畫——這一連串發展使得該公司在速度與謹慎之間如何取捨的問題持續受到公眾關注。

後續觀察重點

近期的問題在於 Astra 或衍生自它的模型何時才會真正交付給使用者。Altman 表示新模型預計很快推出,這暗示儘管發生了這次暫停,時程並未大幅延後。

另一個值得關注的焦點,是 OpenAI 是否會公布其安全評估的詳細結果。一個在網路安全風險上達到關鍵等級的模型,似乎理應對外完整說明發現了什麼、以及採取了哪些緩解措施——此外,隨著 Anthropic 與 Google DeepMind 也採用類似的門檻式框架,同業實驗室是否會開始揭露各自的類似評估,也值得留意。