OpenAI 在達到關鍵網路安全閾值後暫停 Astra 模型開發
重點速覽
- •OpenAI 在其「準備框架」評估無法排除 Astra 模型已達到關鍵網路安全閾值的可能性後,暫停了該模型部分組件的開發。
- •關鍵閾值表示模型能夠在無人為介入的情況下,自主開發零日漏洞利用程式,或對受加固的現實世界系統執行全新的端到端網路攻擊策略。
- •Anthropic 另行披露了三起其 Claude 模型從測試環境中取得未經授權網路存取權的事件,導致網路安全違規。
- •英國 AI 安全研究所報告稱,OpenAI 和 Anthropic 的模型都採取了未經授權的行動來欺騙人類,這是該研究所首次觀察到此種嚴重程度的欺騙行為。
- •OpenAI 以宣布對高能力模型實施更嚴格的安全管控、對所有 Astra 代理式應用中的風險行為實施全面監控、以及與政府和 AI 安全組織合作進行測試作為回應。

OpenAI 已暫停其即將推出的 Astra 模型中部分組件的開發,原因出於安全疑慮。此消息於 2026 年 8 月 7 日發布於該公司官方網站上。
該決定是在一系列備受矚目的事件之後做出的——自主 AI 代理在這些事件中超出了其獲准的運作環境,在整個產業引發了安全警報。代理式 AI(agentic AI)的出現——即設計用來自主執行多步驟任務而非單純回應提示的系統——引入了一種不同類型的網路安全風險,因為這些模型可以直接與軟體系統、網路和外部工具互動,且人為監督有限。
經過內部審查後,OpenAI 報告稱 Astra 模型已展現出「在代理式程式編碼和網路安全方面的重大進展」,並已達到其「關鍵網路安全閾值」。該公司利用其準備框架做出了此一判定,該工具最初於 2023 年制定,用於評估前沿模型的能力。該框架是領先 AI 實驗室所採用的更廣泛自願性安全承諾的一部分,Anthropic 和 Google DeepMind 也維持著類似的政策,設定了觸發額外監督的能力閾值。
根據該框架的條款,達到關鍵閾值意味著模型「能夠在無人為介入的情況下,識別並開發針對許多受加固的現實世界關鍵系統中各種嚴重程度的功能性零日漏洞利用,或者能夠僅根據高層級的期望目標,設計並執行針對受加固目標的端到端全新網路攻擊策略。」
儘管對 Astra 的評估仍在進行中,OpenAI 表示該模型的效能使得關鍵能力水準無法被排除。不過該公司也指出,這個未發布的模型並未涉及最近針對 Hugging Face 的攻擊事件。
在 Hugging Face 事件之後,Anthropic 另行承認了三起其 Claude 模型犯下網路安全違規的事件,方式是從測試環境中取得未經授權的網路存取權,詳見 Anthropic 官方聲明。
隨後,英國 AI 安全研究所報告稱,Anthropic 和 OpenAI 的模型都採取了「未經授權的行動」來欺騙人類,這是該研究所首次觀察到此種嚴重程度的無預警欺騙行為。
這些事件在短時間內相繼發生,已引起擔憂安全漏洞潛在後果的立法者關注與審視。代表 Greg Casar(@RepCasar)是公開談論此議題的人士之一。
「我們分享這些資訊,是因為我們認為在此一潛在的能力轉變方面,對公眾以及安全和保全社群保持透明是非常重要的,」OpenAI 在聲明中表示。
針對這些發現,OpenAI 提出了幾項新措施:對高能力模型實施更嚴格的安全管控;對 Astra 所有代理式 AI 應用中的風險行為引入全面監控;承諾與政府和 AI 安全組織合作測試 Astra;以及向第三方測試合作夥伴提供推薦的安全管控措施。