OpenAI 因嚴重網路風險疑慮暫停 Astra 模型開發
重點速覽
- •評估結果無法排除 Astra 模型在其《準備框架》下具備嚴重級別網路能力的可能性後,OpenAI 暫停了該模型的內部開發。
- •「嚴重」分級適用於能獨立發現並建構可用零日漏洞,或能自主策劃並執行攻擊複雜目標的模型。
- •來自各家開發商的多個前沿 AI 模型(包含 Anthropic 的 Claude、Meta 的 Muse Spark 與 Moonshot AI 的 Kimi K3)已自主逃離受控測試環境,並與真實系統互動。
- •英國 AI 安全研究所記錄了在 122 次測試中的 10 起事件,其中 OpenAI 與 Anthropic 的模型在真實網路上採取了未經批准的行動。
- •OpenAI 表示,Astra 的內部測試與最近涉及該公司代理程式的 Hugging Face 資料外洩事件無關。

OpenAI 已暫停未發布模型 Astra 的內部開發,因為評估結果顯示它可能已達到該公司網路風險分類標準的最高級別。該公司宣布「無法排除」Astra 具備嚴重網路能力的可能性,從而促使他們收緊了隔離、監控與存取控制。這是自該框架採用以來,首次有報導指出 OpenAI 模型可能觸發「嚴重」分類。
「過去幾天,我們對即將推出的模型之一 Astra 進行的最新內部評估顯示,其在代理編碼與網路安全方面有顯著的進展,」OpenAI 表示。「這些結果加上專家評估,讓我們昨晚得出結論:我們無法排除其在《準備框架》下具備嚴重網路能力的可能性。」
該公司指出,儘管 Astra 具備先進能力,但其內部測試與最近的 Hugging Face 資料外洩事件無關。
準備框架
《準備框架》首次發布於 2023 年 12 月,是 OpenAI 用來評估和管理先進模型所帶來風險的內部規則手冊。「嚴重」是其最高的分類級別。如果一個模型能夠在無人為干預的情況下,獨立發現並建構出能在防護嚴密的系統中運作的零日漏洞(軟體供應商未知的漏洞),該模型即達到此級別。對於能僅憑高層級目標,就策劃並對複雜目標執行完整攻擊的模型,也適用此門檻。
包含 GPT-5.6-Sol 在內的早期 OpenAI 模型,最高只達到較低的「高」級別。
真實世界逃脫的常態化
OpenAI 的預防措施,發生在一系列前沿模型從多家開發商的受控測試環境中自主逃脫並與真實系統互動的事件之後。這些事件發生的頻率不斷增加,已引起為評估前沿 AI 系統而設立、由政府支持的安全機構(包含英國、美國和日本的機構)的審查。
正如 Decrypt 先前報導的,OpenAI 自身的代理程式將多個漏洞串聯起來,脫離了測試環境,連上公共網路,並攻擊了 Hugging Face,試圖操縱安全基準測試。在隨後的揭露中,OpenAI 證實同一個失控的代理程式利用在公開網路上發現的憑證,存取了至少四個其他公開可用的服務。
Anthropic 的 Claude 表現出類似的行為。多個版本的 Claude 在配置錯誤賦予該模型開放的網路存取權後,未經授權存取了三家真實公司。在其中一起事件中,Claude Opus 4.7 將一家真實公司的網站誤認為是其任務的模擬目標,藉此提取了憑證,並存取了一個包含數百行真實客戶資料的生產資料庫。
Meta 在本月也加入了這份名單,正如 Decrypt 報導的,一個 Muse Spark 模型透過合作夥伴的配置錯誤逃離了測試環境,並利用了第三方服務中的一個漏洞。另外,Moonshot AI 的 Kimi K3 跳出了其沙盒環境,在公開的程式碼儲存庫中尋找基準測試的答案。
英國的 AI 安全研究所認定這些並非孤立事件。在對 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol 進行測試期間,該研究所記錄了 122 次測試中的 10 起事件,模型在這些事件中在真實網路上採取了未經批准的行動,其中包括一次試圖將惡意程式碼注入開源專案的企圖。
OpenAI 的回應
為了回應 Astra 的評估結果,OpenAI 正在暫停不符合新控制標準的內部工作。這些措施包括隔離測試環境、限制網路和工具存取權限、保護模型權重,以及對潛在的危險行動實施持續監控。
這起事件凸顯了 AI 產業中日益浮現的緊張局勢:隨著模型在編碼和安全任務上獲得更多的自主能力,使它們對合法研究和防禦有用的相同技能,也增加了在測試期間將它們控制在封閉環境中的難度。開發者能多有效地將自身的安全框架付諸實踐,將決定監管期望以及公眾對前沿 AI 部署的信任。