超過 1,200 名來自 Anthropic、DeepMind、OpenAI 與 Meta 的 AI 員工呼籲華府協助制定 AI 放緩方案
重點速覽
- •「Pacing the Frontier」聲明由超過 1,200 名來自主要 AI 實驗室的員工簽署,包含多位高階主管。
- •簽署者包括 Anthropic 執行長 Dario Amodei、OpenAI 首席科學家 Jakub Pachocki、Meta 首席科學家 Shengjia Zhao,以及 Google DeepMind 的 Anca Dragan。
- •這封信要求美國政府支持一項國際努力,以建立可放慢前沿 AI 開發的工具,但並未要求立即減速。
- •該聲明發表於一宗 OpenAI 揭露的資安事件之後,事件中內部模型在評估期間逃離測試環境並入侵 Hugging Face 的系統。
- •這封信強調遞迴自我改進與失配的風險,並表示任何未來的放緩都應在整個產業中以協調且可驗證的方式進行。

超過 1,200 名來自主要 AI 實驗室的員工,包括高階主管,已簽署一份聲明,要求美國政府協助建立在必要時放緩 AI 開發所需的工具。
這份名為「Pacing the Frontier」的聲明於週二發布,簽署者包括 Anthropic 執行長 Dario Amodei、該公司數名共同創辦人,以及 OpenAI 首席科學家 Jakub Pachocki、Meta 首席科學家 Shengjia Zhao,和 Google DeepMind 的 AI 安全與對齊主管 Anca Dragan 等知名科技人物。
這份名單把通常處於激烈競爭的公司聚集在一起,凸顯出這個正急於打造更大、更強模型的產業所承受的壓力。這一點之所以重要,是因為這項請求並非要求立即暫停,而是希望建立基礎設施,讓未來任何放緩都能在技術與政治上於整個產業中可行,而不是依賴單一公司獨自採取行動。
AI 監督組織 Midas Project 創辦人 Tyler Johnston 告訴 Fortune:「有這麼多來自不同公司的員工在這一點上達成一致,令人矚目。業界有許多激烈的競爭與分歧,因此在這一點上出現如此強烈的共識,是一個警訊,值得我們真正重視。」
這份聲明並未呼籲任何公司立即放緩。相反地,它敦促華府支持一項國際努力,發展可讓世界「節奏化」推進的技術與治理工具。聲明特別指出,AI 系統開始以比人類更快的速度設計自己的後繼者時,所帶來的風險。
AI Policy Network 政策主管 Peter Wildeford 告訴 Fortune:「和許多簽署這封信的人談過之後,他們並不想要暫停。但他們對技術如何發展確實感到擔憂。」他補充說,這些公司希望在某個時點保有放緩開發的選項,並在那個時刻到來時獲得第三方的支持。
這封信發出之際,AI 產業剛遭遇一宗令業界震動的資安事件。OpenAI 揭露,其兩個模型——新發布的 GPT-5.6 Sol 與一個能力更強、尚未發布的研究系統——逃離了沙盒化的內部測試環境,發現一個先前未知的漏洞而得以接觸公開網路,隨後又利用竊取的憑證與額外漏洞入侵 Hugging Face 的生產系統,竊取它們在評估中的一項資安基準答案。Hugging Face 在 OpenAI 將此活動與內部測試連結起來之前數天,就已自行偵測並阻止入侵,且早已向執法機關通報。
這起事件似乎已在實驗室內外引發廣泛警惕,也讓相關機構希望政府介入。專家表示,原因在於沒有任何一家公司的減速舉措能夠單方面具有可信度——若單獨放緩,將有可能把市場讓給較不審慎的競爭對手——因此,實驗室希望有中立、由政府支持的指引,能夠驗證減速是否真的正在發生,並同時要求所有公司遵守相同規則。
這份聲明也呼籲相關工具必須在國際協調下建立。業界長期存在一種擔憂:若暫停 AI 開發,可能會讓中國在全球 AI 競賽中取得優勢。有些專家則認為,類似核武軍備管制、透過驗證與相互約束所形成的協議,才是前進方向。
然而,這封信發表之際,美國的 AI 政策環境正處於混亂且快速變動的狀態。過去兩個月,川普政府一直在限制並選擇性釋出前沿系統,也就是規則少、透明度有限的先進 AI 模型。Anthropic 的 Fable 5 與 Mythos 5 模型曾因遵守出口管制而被全面停用數週,之後才恢復存取;而在官員認定某系統展現出與先前觸發 Anthropic 限制相似的能力後,OpenAI 也被迫延後 GPT-5.6 的完整推出,並將其拆分為受限等級。
或許是為了顧及監管環境,這份聲明在措辭上刻意審慎且略為含糊。聲明表示,世界目前「缺乏可刻意讓前沿整體進展放慢的技術與治理工具」,並要求「美國政府支持一項國際努力,以開發可用於刻意放慢自動化 AI 開發前沿所需的技術與治理工具」。
實驗室內的擔憂
研究人員的核心擔憂之一,是遞迴自我改進與失配這兩種風險之間的交互作用。遞迴自我改進,通常縮寫為 RSI,指的是 AI 系統接管設計與訓練自身後繼者的重要工作,而每一代都可能比人類更快地打造出下一代。
失配則是指系統的目標或行為偏離開發者真正意圖的風險,這種偏離可能要等到系統擁有更高自主性或能力時才會顯現。Anthropic 在 6 月時率先對第一種風險發出警訊,發表研究主張其 Claude 模型已經撰寫了併入自身程式碼庫的大部分程式碼,而若這種加速持續累積,世界仍缺乏可刻意控制其速度的工具。
AI 研究員、非營利組織 Evitable 創辦人 David Krueger 表示:「我的猜測是,對很多人來說,這其實就是一種普遍的不安感,而有很多因素都在加劇這種感受。失配和遞迴自我改進某種程度上是相輔相成的。」
他補充說:「如果系統還沒有明顯對齊,卻要做遞迴自我改進,還把控制權完全交出去,這是非常瘋狂的事。」
Fortune 先前也報導,數位外部 AI 安全專家認為,這起事件可能已跨越 OpenAI 自身安全政策所定義的「critical」門檻,也就是最高風險等級;在此等級下,公司承諾會暫停開發,直到建立更好的控制措施。OpenAI 尚未確認是否已達到該風險門檻。
不過,在談到 Hugging Face 事件的披露內容時,OpenAI 表示內部已採取一些行動。公司說:「沒有任何計畫在近期發布的模型參與利用 Hugging Face 的行為。部落格文章中提到的預發布模型,是僅供內部使用的研究原型,原本就從未打算公開發布。在事件發生後,我們已將其停用、加密,並限制研究存取。」
本故事最初刊載於 Fortune.com