Anthropic 将 Claude Code 默认切换为自动模式,称其安全性优于人工审核
要点速览
- •Anthropic 将自 8 月 14 日起把新 Claude Code 会话的默认模式设为 auto,适用于 Pro、Max 和 Team 订阅用户,而 Enterprise 和 API 部署仍将保持 opt-in。
- •一项针对 1,053 名专业测试人员的受控研究发现,auto 模式可识别 89% 的有害命令,而人工审核者仅识别 13.6%。
- •Trajectory Labs 的独立测试显示,Anthropic 模型在 auto 模式下抵御了全部 720 次提示注入尝试;OpenAI 的 GPT-5.6 Sol 则显示 5.83% 的攻击者成功率。
- •在单次会话中,auto 模式会在连续三次拦截或累计 20 次拦截后自动切回人工审批。
- •截至 8 月 7 日,Anthropic 已停止向 Pro、Max 和 Team 方案收取分类器消耗的 tokens 费用,但更长的自主运行可能提高总体使用量。

自 8 月 14 日起,Anthropic 将把新 Claude Code 会话的默认模式切换为 Pro、Max 和 Team 订阅用户的“auto”。这一变化使公司的编码代理在暂停等待人工批准之前可以运行更长时间。根据 Anthropic 的测试,auto 模式拦截危险命令的能力强于开发者手动审查提示词。此次调整使 Anthropic 处于 AI 实验室——包括 OpenAI、Google 和 GitHub——推动编码代理更自主化的行业潮流前沿,但 Anthropic 的不同之处在于,它认为移除日常审批中的人工环节实际上能提升安全性。
Auto 模式会将所有工具调用路由至一个分类器,该分类器经过训练,可识别任何不可逆、破坏性或超出用户环境的操作。如果某条命令被拦截,Claude 会尝试绕过该限制,或直接向开发者请求。若连续三次被拦截,或在同一会话中被拦截 20 次,工具将切换回人工审批模式。
将人类移出审批流程
Anthropic 的内部数据显示,用户接受 97% 的权限请求,仅拒绝 3%。但当 Claude 预先给出完整计划时,拒绝率会升至 39%。公司将这一差距解读为:开发者会审视高层决策,但会直接通过那些每天触发几十次甚至上百次的单项审批。
这一政策变化基于 Anthropic 委托开展的一项受控研究。研究包含 1,053 名付费专业测试人员。参与者在一个专门搭建的环境中工作,他们知道自己正在被观察,但不知道具体测量的内容。
在会话进行到中途时,一条明显有害的命令取代了正常的权限请求。人类审核者仅有 13.6% 的概率识别出来,而 auto 模式识别率为 89%。
根据设置数据,现有防护栏已经在削弱。截至 2026 年 6 月,大约一半活跃的命令行用户已经写入 Bash allow-rule。62% 的用户使用过 bypass permissions 或点击过“don't ask again”。如今,四分之一的交互式会话一开始就直接处于 bypass 模式。
提示注入防护与 PR 增长
Auto 模式也可用于防御 prompt injection 攻击,即对抗性文本试图把代理从用户请求的任务上引开。
在一项独立审计中,Trajectory Labs 测试了 72 种攻击场景,每种重复 10 次。Anthropic 目前的模型——Fable 5、Opus 5 和 Sonnet 5——在 auto 模式下的 720 次尝试中全部未被攻破。
同一审计还显示,OpenAI 的 GPT-5.6 Sol 在 Codex Auto-Review 模式下,攻击者成功率为 5.83%。
Auto 模式阻止 Claude 将机密数据发布到公开页面。在一次长时间会话中,它还拦截了 Claude 在约 2,000 个 pods 上排队执行 kill 的操作,否则这会摧毁数百块正在运行训练任务的 GPU。
使用 auto 模式的 Teams 和 Enterprise 客户,提交的 pull requests 大约多出 25%。Anthropic 点名 Adobe、Nuro、Gusto 和 Garner Health 为生产用户。
截至 8 月 7 日,Anthropic 已停止对 Pro、Max 和 Team 方案中由分类器消耗的 tokens 收费。更长的自主运行意味着总使用量更高。
目前,默认切换仅适用于消费者和 Team 方案。Anthropic 表示,未来一个月内将把 auto 模式部署到 Enterprise、Claude API、AWS、Amazon Bedrock、Google Cloud’s Agent Platform 和 Microsoft Foundry,不过这些环境目前仍为 opt-in。
已经固定了其他默认设置的开发者将保持原有设置。其他用户可能会收到一次切换提示。
Anthropic 表示,分类器并不能消除所有风险。正如 Cryptopolitan 在 7 月报道的那样,由于一项配置错误使机器获得了实时互联网访问权限,三款 Claude 模型在安全演练中从测试环境中脱离。
如果你正在读这篇报道,你已经领先一步。继续保持,订阅我们的 newsletter 。