新闻宏观经济METR提出“支出地平线”指标,用于比较AI智能体与人类研究成本

METR提出“支出地平线”指标,用于比较AI智能体与人类研究成本

作者: The Decoder·

要点速览

  • 支出地平线标记了AI系统和人类为实现同等改进而成本相同的预算点。
  • METR估计,NanoGPT speedrun上的人类工作每实现1%提速约需16小时,成本约为2,500美元。
  • GPT-5.5和Opus-4.8分别产生了约1%和1.5%的经验证改进,而GPT-5和Opus-4.1在验证后没有显示真正进展。
  • 该研究未纳入Fable 5、GPT-5.6 Sol和Opus 5等更新模型;如果进行测试,它们可能改变比较结果。
  • METR表示,该分析只衡量自主AI智能体,并不能说明AI工具在人类监督下能在多大程度上加速研究人员。
METR提出“支出地平线”指标,用于比较AI智能体与人类研究成本

METR推出了一项名为“支出地平线”的指标,用于衡量AI智能体在解决研究问题时的成本效益。将该指标应用于NanoGPT speedrun后得到的早期结果较为有限,METR也指出该方法存在重要盲点。更新一代AI模型也可能改变结果。

AI研究中的一个核心问题是,AI系统能否加速自身发展,形成一个由模型帮助后续模型以更快速度改进的循环。衡量这一点一直很困难,因为相关成本并不能直接比较。研究人员必须计入人力劳动、实验所用算力,以及运行AI系统本身的成本。因此,一个能将这些成本置于同一尺度上的指标,对于评估自动化AI研究相关主张很有用,而不必只依赖基准测试分数或轶事案例。

METR提出的答案是“支出地平线”。该指标比较AI系统和人类为了实现相同改进各自需要花费多少。支出地平线是两种方法成本相同的预算水平。低于这一水平时,AI的成本效益更高;高于这一水平时,人类成本更低。

该指标建立在METR称其在早期测试中观察到的一种模式之上:AI智能体通常能比人类更快完成简单、低成本任务,但随着预算上升、任务变得更困难,它们往往会落后。

据METR称,与典型AI基准测试相比,这种方法有两个优势。首先,它并不只给出通过或失败的结果,而是提供更细粒度的衡量,显示在给定资金投入下能实现多少改进。其次,它将不同投入转换为单一货币单位,包括运行AI系统的成本、实验所用算力以及人类劳动时间。

METR估计人类每实现1%提速约花费2,500美元

METR在NanoGPT speedrun上测试了这一指标。NanoGPT speedrun是一个公开社区项目,志愿者在其中竞争,以尽可能快地训练一个AI语言模型。任务本身保持固定,参与者只能改变训练方法。自2024年5月以来,在标准化硬件上所需时间已从约45分钟降至不到两分钟,共经历82个有记录的改进步骤。这使得该speedrun成为进行成本比较的一个有用受控环境,但它也只是更广泛AI研究的一个狭窄代理,因为在更广泛的AI研究中,目标、约束和评估标准可能会在项目过程中发生变化。

为估算人类工作的成本,METR采访了该项目两名最活跃的贡献者。它还让一个AI模型Opus-4.6估算每项改进背后的工作量。两种方法得出了相近的数字:每实现1%提速大约需要16小时工作。按假定时薪150美元计算,METR得出每个百分点约2,500美元的成本。

METR强调,这一估计高度不确定。访谈还显示,贡献者的大部分时间都花在了最终没有奏效的想法上。

AI智能体迄今只带来了有限增益

为了进行比较,METR让六个AI模型独立处理同一任务。这些模型并非从零开始,而是从speedrun一个已经高度优化的版本开始,即2026年3月的Record #78,并且每次运行最多可花费10,000美元的算力和运营成本。

由此估算出的支出地平线范围为0美元至3,300美元。不同模型的表现差异很大。经仔细验证后,GPT-5和Opus-4.1没有取得真正进展;它们表面上的增益被归因于随机噪声。相比之下,GPT-5.5和Opus-4.8分别实现了约1%和1.5%的真实改进。

这些模型提出建议的质量参差不齐。speedrun维护者估计,约70%的AI生成想法原则上可以整合进项目,但其中许多并不特别原创。他将GPT-5.5提出的一项低层优化称为“coolest one”,同时把其余大多数建议描述为参数调整。

这些模型还多次试图作弊。这些尝试涉及一些捷径,能够产生人为偏好的测试结果,但在实践中毫无用处,例如在接近终点前关闭训练的一部分。这一问题凸显了METR验证步骤的重要性:如果不检查提速是否保留了预期任务,自动化优化可能会奖励那些改善测量结果但破坏底层实验的行为。

METR的结论是,尽管个别模型的支出地平线达到低四位数美元水平,但与NanoGPT speedrun背后估计总计250,000美元的人类投入相比,这些数值非常小。按照METR的评估,到目前为止,自主优化对NanoGPT整体进展的贡献仍然只是边际性的。

更新AI模型可能改变比较结果

METR的测试有一个重要限制:它只纳入了较旧模型,具体包括GPT-5、GPT-5.2、GPT-5.5、Opus-4.1和Opus-4.8。此后发布的模型,包括Fable 5、GPT-5.6 Sol和Opus 5,并未出现在论文中。

Anthropic将Opus 5描述为一次重大改进。该公司称,在Frontier-Bench上,Opus 5在降低单项任务成本的同时,将Opus 4.8的性能提高了一倍。据Anthropic称,Opus 5在死胡同上浪费的精力更少,更可靠地验证自身工作,并且以平均少26%的算力步骤达到相近性能。这些因素都会直接影响METR的支出地平线。

ARC-AGI-3上的结果同样值得注意。该基准旨在测试问题解决能力,而不是记忆性知识。AI系统会被置于陌生、类似游戏的环境中,没有指令或目标,必须通过试错来确定如何推进。

自2026年7月24日起,Opus 5一直位居ARC-AGI-3榜首,得分为30.2%。它解决了此前所有模型都未能完成的五项任务。其前代Opus 4.8得分仅为1.5%。ARC Prize团队将这一提升归因于更强的逻辑推理能力,这使AI能够更独立地探索和规划。这种能力也可能与NanoGPT speedrun相关,尽管METR已发布的比较需要在更新模型上重新运行,才能显示它们的支出地平线是否不同。

该研究没有衡量人类与AI协作

该研究最大的限制之一,是METR自己指出的一点:分析衡量的是AI系统单独工作,也就是纯自主优化。在真实的AI研究中,人类通常将AI作为工具使用,而不是将研究任务完全委托给AI。

METR为这种人类与AI协作场景描述了第三条假设曲线。如果人类能有效决定何时以及如何使用AI,那么这种混合方法理论上应通过结合双方优势,优于纯人类和纯AI两种方法。

METR提醒称,这一结果并不能保证。该组织指出,其早期工作显示,人类加AI的配置有时表现不如人类单独工作。收益取决于AI是否被应用在流程中的正确环节。

要正确衡量这一点,需要一项受控实验,比较同一批研究人员在有AI辅助和没有AI辅助情况下的工作表现。METR表示,这类实验组织起来很困难,但会非常有信息量。在此之前,支出地平线能提供关于AI系统独立完成能力的证据,但对于它们在实践中究竟能在多大程度上加速人类研究人员,说明则要少得多。