新闻宏观经济Anthropic 披露研发自动化水平、智能体监督数据与安全算力指标

Anthropic 披露研发自动化水平、智能体监督数据与安全算力指标

作者: Metaverse Post·

要点速览

  • •Anthropic 新推出的研发自动化指数按照 Epoch AI 的 AL0–AL5 自动化量表对公司内部每项 AI 研发任务进行评级,截至 2026 年 8 月,AI 主导了该公司约 26% 的研发工作,而 Claude 在所有被测量领域均未实现自主运行。
  • •Anthropic 超过 90% 的研发任务达到或超过 AI 与人类协作的水平,该公司用这些数字来衡量行业距离递归自我改进还有多远。
  • •大约 30,000 个 AI 智能体在 Anthropic 使用最频繁的内部平台上开展研究和工程工作,在 8 月份分析的超过 10 亿次智能体决策中,约 0.002% 被拦截,每周约有 100,000 份对话记录被标记,仅约 50 份升级至人工审查。
  • •在一周的算力快照中,约 6% 的 Anthropic AI 研发算力投入安全工作,在 AI 驱动的研发中约为 12%,该公司称这些为有意保守的估计。
  • •Anthropic 计划嵌入可获取与其内部风险团队相当权限的独立第三方评估人员,但承认目前尚无统一的方法论用于跨实验室比较自动化指标。
Anthropic 披露研发自动化水平、智能体监督数据与安全算力指标

Anthropic 发布了一套内部测量指标,旨在让公众、监管机构和第三方观察者更清楚地了解前沿 AI 开发的推进速度——包括目前有多少构建新模型的工作正由 AI 自身完成。

此次发布的核心是 Anthropic 研发自动化指数,这是一项原型指标,对公司内部每一类 AI 研发任务进行编目,并按照 Epoch AI 开发的自动化量表进行评级。该量表从 AL0(表示无 AI 参与)到 AL5(表示完全自主运行、无人类参与)。在这一框架下,AL3 表示 AI 在人类密切指导下协作的任务,而 AL4 涵盖 AI 从高级提示出发、在人类监督下端到端完成的任务。这些等级与 AL5 之间的距离正是该指数的意义所在:它逐项衡量公司的研发运营距离 AI 能够在无人类参与的情况下承担工作还有多远。

截至 2026 年 8 月,Claude 在任何被测量的 AI 研发领域均未实现完全自主运行。尽管如此,AI 主导了 Anthropic 约 26% 的研发工作,超过 90% 的任务达到或超过 AI 与人类协作的水平。Anthropic 将这些数字作为追踪行业距离递归自我改进——即模型自主构建自身后继者的情景——有多近的一种方式,并指出在任何协调放缓前沿开发的努力下,这些数字都可能发生变化。以这种方式来看,此次发布将一个抽象的担忧转化为一个明确的、可重复的基线,未来披露的数据都可以据此进行衡量。

该公司在 X 上发布帖子宣布了这一披露:

AI systems are getting more powerful, and they're increasingly being used to build the next version of themselves. We want to illuminate that progress for the public. Today, we're sharing three measurements that help track development: 1. How much AI R&D is done by AI. 2. How…

— Anthropic (@AnthropicAI) September 17, 2026

这些测量指标共同涵盖了 AI 完成了多少研发工作、AI 智能体在实践中如何受到监督,以及算力如何在该公司的各项工作之间分配。

该公司还将这一指数与关于 AI 智能体监督的新数据相结合。大约 30,000 个智能体在 Anthropic 使用最频繁的内部平台上开展研究和工程工作,它们的每一项操作在执行前都要经过实时在线监控器,之后还要经过离线监控器的审查。在 8 月份分析的超过 10 亿次智能体决策,约 0.002%——大约每 47,000 次中有一次——被拦截。离线监控器每千份对话记录会标记一到两份,每周约有 100,000 份被标记,而其中仅约 50 份升级至人工审查。这些数字勾勒出一个不断收窄的监督漏斗——从 8 月份分析的超过 10 亿次决策,到每周被标记的约 100,000 份对话记录,再到约 50 份升级至人工审查——展示了随着智能体承担实际的研究和工程工作,自动化筛选如何在人类判断之下层层部署。

算力分配成为可验证的节奏调节杠杆

第三项测量涉及算力——AI 开发中最可验证的投入之一,因此也是未来任何全行业节奏调节机制的潜在杠杆。在对 Anthropic 总算力使用情况为期一周的快照中,约 6% 用于 AI 研发的算力投入了安全工作;在 AI 驱动的研发中,这一比例约为 12%。该公司称这些是有意保守的估计,并指出算力是安全投资的不完善代理指标,因为许多安全研究是设计密集型而非算力密集型的。这些百分比也是外部各方——或未来的节奏调节协议——能够随时间追踪的硬性、可计数的数据。

Anthropic 将此次发布定位为其负责任扩展政策风险报告及其高级 AI 框架政策提案的补充,后者概述了政府可以对实验室施加的透明度义务。该公司还宣布计划在 Anthropic 内部嵌入来自多个组织的独立第三方评估人员,授予他们与其内部风险评估团队相当的内部系统和数据访问权限。

跨实验室比较仍是一大挑战。Anthropic 承认目前尚无统一的自动化测量方法论,而使用自家模型评估自身系统会产生潜在的盲点。该公司指出,第三方验证,或在保护竞争敏感信息的前提下由其他开发商的模型进行评估,是走向政府和公众可以信赖的标准化报告的一条路径。在这样的方法论出现之前,像 26% 的自动化率这样的数字在其他开发商那里没有对应的公认指标——这使得计划中的独立评估人员嵌入,以及任何朝向统一测量标准的进展,成为衡量这一透明度努力能否超越单一实验室的具体标志。

来源:Metaverse Post