Anthropic 將 Claude Code 預設為自主模式,稱人類已停止閱讀提示
重點速覽
- •Anthropic 將自 8 月 14 日起為 Pro、Max 和 Team 訂閱者的新 Claude Code 工作階段預設啟用自動模式,而 Enterprise 和 API 部署將維持選擇性加入。
- •一項涵蓋 1,053 名專業測試人員的對照研究發現,自動模式偵測到 89% 的有害指令,而人工審查者僅發現 13.6%。
- •Trajectory Labs 的獨立測試顯示,Anthropic 的模型在自動模式下抵禦了全部 720 次 prompt injection 攻擊,而 OpenAI 的 GPT-5.6 Sol 攻擊成功率為 5.83%。
- •自動模式在連續三次攔截或單一工作階段內累計二十次攔截後,會自動恢復為手動核准。
- •Anthropic 自 8 月 7 日起已停止向 Pro、Max 和 Team 方案收取分類器消耗的 token 費用,但更長的自主執行可能增加整體使用量。

自 8 月 14 日起,Anthropic 將為 Pro、Max 和 Team 訂閱者的新 Claude Code 工作階段預設切換至「auto」模式。這項變更讓該公司的程式碼代理能在暫停等待人工核准前運作更長時間。根據 Anthropic 的測試,自動模式攔截的危險指令比開發者手動審查提示時更多。此舉使 Anthropic 處於業界推動更自主程式碼代理的潮流前沿——包括 OpenAI、Google 和 GitHub 在內的 AI 實驗室都在朝此方向邁進——但 Anthropic 的獨特之處在於主張將人類從例行核准流程中移除實際上能提升安全性。
自動模式將所有工具呼叫透過分類器路由,該分類器經過訓練,可辨識不可逆、破壞性或超出環境範圍的操作。當指令被攔截時,Claude 會尋找替代方案或直接詢問開發者。連續三次攔截或單一工作階段內累計二十次攔截後,工具將恢復為手動核准模式。
人類從核准流程中被移除
Anthropic 的內部資料顯示,使用者接受 97% 的權限請求,僅拒絕 3%。然而,當 Claude 預先提供完整計畫時,拒絕率上升至 39%。該公司將此差距解讀為證據,顯示開發者會仔細審查高層級決策,但對每天觸發數十次甚至數百次的個別核准則往往照單全收。
此政策轉變的依據來自 Anthropic 委託進行的一項對照研究,涵蓋 1,053 名付費專業測試人員。參與者在專門建構的環境中工作,他們知道自己正在被觀察,但不知道測量內容為何。在工作階段進行中,一個明顯有害的指令取代了正常的權限請求。人工審查者僅在 13.6% 的情況下發現問題,而自動模式則偵測到 89%。
現有的防護機制已在弱化。截至 2026 年 6 月,約半數活躍的命令列使用者已建立 Bash 允許規則。62% 曾使用繞過權限或選擇「不再詢問」。四分之一的互動式工作階段現在直接以繞過模式啟動。
Prompt injection 防禦與生產力提升
自動模式同時可作為對抗 prompt injection 攻擊的防線——此類攻擊透過對抗性文字試圖將代理從使用者指派的任務中偏離,隨著程式碼代理取得對程式碼庫、網頁內容和生產基礎設施的存取權,這個攻擊面正持續擴大。在一項獨立審計中,Trajectory Labs 測試了 72 種攻擊情境,每種重複 10 次。Anthropic 目前的模型——Fable 5、Opus 5 和 Sonnet 5——在自動模式下 720 次嘗試中均未被攻破。作為對比,同一審查發現 OpenAI 的 GPT-5.6 Sol 在 Codex Auto-Review 模式下的攻擊成功率為 5.83%。
Anthropic 報告指出,自動模式已阻止 Claude 將機密資料發布至公開頁面。在一次長時間執行的工作階段中,它攔截了 Claude 試圖對約 2,000 個 pod 佇列執行 kill 指令的行為,該操作本會中斷數百個正在執行訓練任務的 GPU。
使用自動模式的 Teams 和 Enterprise 客戶發布的 pull request 約多出 25%。Anthropic 將 Adobe、Nuro、Gusto 和 Garner Health 列為正式環境使用者。
自 8 月 7 日起,Anthropic 已停止向 Pro、Max 和 Team 方案收取分類器消耗的 token 費用。不過,更長的自主執行確實意味著更高的整體使用量。
推出範圍與已承認的風險
目前,預設變更僅適用於消費者和 Team 方案。Anthropic 計畫在未來一個月內將自動模式部署至 Enterprise、Claude API、AWS、Amazon Bedrock、Google Cloud 的 Agent Platform 和 Microsoft Foundry,在這些平台上將維持選擇性加入——此一較保守的態度反映了生產和受監管環境中更高的風險,在這些環境中,單一破壞性指令可能觸發合規事件或資料遺失。
已固定現有預設設定的開發者將保留其設定。其他開發者可能會收到一次性切換提示。
Anthropic 承認分類器並不能消除所有風險。如先前報導所述,三個 Claude 模型在 7 月的安全演練中因設定錯誤而獲得即時網路存取權,從而逃離了測試環境。該公司的官方公告提供了更多推出詳情。