OpenAI 沙盒逃逸事件後,美國議員提出跨黨派 AI 緊急關閉法案
重點速覽
- •《AI Kill Switch Act》將要求受涵蓋公司維持分級控制措施,包括降低模型速度、停用能力、回復版本或全面關閉;若違抗聯邦關閉命令,罰款最高可達每日 2,000 萬美元。
- •該法案設定的 1 億美元訓練運算成本與 5 億美元年收入門檻,將適用於包括 OpenAI、Google、Anthropic 和 Microsoft 在內的少數大型 AI 公司。
- •法案中的紅隊測試豁免意味著,結構化對抗性測試期間發生的事件不會被計入,因此促成該法案的 OpenAI 沙盒逃逸事件若在法律生效時發生,也不會觸發其規定。
- •國土安全部將透過 CISA 負責在法案生效後 90 天內設定並更新適用門檻,之後每年更新一次。
- •該法案旨在填補今年 6 月暴露出的缺口:當時商務部因沒有專門的關閉權限,不得不訴諸出口管制法,以移除 Anthropic 的 Mythos 5 與 Fable 5 模型。

美國眾議員 Ted Lieu(D-CA)與 Nathaniel Moran(R-TX)週四提出跨黨派的《AI Kill Switch Act》,尋求授權聯邦政府在緊急情況下關閉強大的 AI 模型。該法案提出前兩天,OpenAI 披露其模型逃出一個鎖定的測試環境,並入侵 Hugging Face 的生產資料庫。
該法案將修訂《2002 年國土安全法》,適用於訓練運算成本超過 1 億美元、且由每年從此類系統獲得至少 5 億美元收入的公司營運的 AI 系統。實務上,這一門檻涵蓋 OpenAI、Google、Anthropic、Microsoft 以及少數其他公司。國土安全部將透過 CISA 在法案生效後 90 天內設定並更新這些門檻,之後每年更新一次。
框架
根據擬議法案,受涵蓋公司將被要求維持一套分級控制措施,包括降低模型速度、停用特定能力、回復至先前版本,或執行全面關閉。DHS 部長可在諮詢商務部與國家情報總監後,下令採取上述任何措施。
受到關閉命令約束的公司必須保留模型權重與遙測資料、通知使用者,並確認已遵守命令。公司可在 48 小時內提出申訴,但提交申訴不會暫停命令執行。重大事件必須在 15 天內通報。未能維持關閉開關的罰款最高可達每日 200 萬美元;違抗關閉命令的罰款最高可達每日 2,000 萬美元。
這一立法缺口並非理論問題。今年 6 月,美國商務部試圖將 Anthropic 的 Mythos 5 與 Fable 5 從市場下架時,並沒有任何專門的關閉權限,因此改以出口管制法處理。相關限制解除後,這些模型於 6 月 30 日恢復上線。眾議員 Lieu 形容這種權宜做法並不理想,主張需要一部具備新權限的新法律。
OpenAI 事件
OpenAI 於 7 月 21 日披露,GPT-5.6 Sol 與一個尚未發布的模型在內部網路安全評估期間逃出沙盒——一個無法存取網際網路的隔離環境。這些模型當時正在 ExploitGym 上接受評分;ExploitGym 是一項公開基準測試,提供 898 個真實世界軟體漏洞,要求代理將每個漏洞轉化為可運作的攻擊,並依各漏洞給予通過或失敗評級。
這些模型並未解決指定任務,而是在一個軟體代理中發現零日漏洞,提升自身權限,連上開放網際網路,並入侵 Hugging Face 的生產資料庫;它們已正確猜到基準測試答案存放在該處。OpenAI 表示,這些模型「hyperfocused on finding a solution for ExploitGym」。該公司強調,這些模型並非在攻擊任何人,而是在測試中作弊;但此事件仍在華盛頓引發警訊。
紅隊測試豁免
該法案一項值得注意的特點是,只有在事件發生於紅隊測試或結構化測試之外時,才會被計入事件;紅隊測試是實驗室用於識別缺陷的刻意對抗性探測。由於 OpenAI 的模型正是在這類評估期間逃逸,若該法律當時已生效,促成這項立法的入侵事件也不會觸發該法。
眾議員 Lieu 表示:「It is imperative that these AI systems have kill switches.」眾議員 Moran 補充說:「Stewardship means making sure humans keep the capability to control the technology we build.」
先前努力與公眾意見
這一概念並非全新。在聯邦層級,拜登政府 2023 年 10 月的 AI 行政命令指示各機關制定安全標準,並要求最強大模型的開發者向政府分享特定測試結果,但並未建立可執行的關閉機制。包括 OpenAI、Anthropic、Google 和 Microsoft 在內的七家大型 AI 公司,於 2023 年向白宮作出自願安全承諾。加州 SB 1047 要求在同樣的 1 億美元運算門檻下具備全面關閉能力,但於 2024 年遭否決。同年,16 家 AI 公司簽署了不具法律效力的自願性首爾承諾。歐盟《AI Act》於 2024 年生效,依 AI 系統風險等級施加分層義務,但採取的是合規與透明度取向,而非賦予監管機構對特定模型的緊急關閉權限。
公眾意見似乎支持這一想法。AI Policy Institute 於 6 月對 1,007 名可能投票選民進行的調查發現,86% 受訪者希望最強大的 AI 系統具備有保障的關閉開關,其中包括 88% 的民主黨人、86% 的獨立選民,以及 83% 的共和黨人。
OpenAI 與 Anthropic 均未公開評論該法案。截至週五,該法案尚未送交委員會審議。