新闻股票OpenAI 在 GPT-6 Astra 发布后悄然修改多项基准评分,部分数据仍在变动

OpenAI 在 GPT-6 Astra 发布后悄然修改多项基准评分,部分数据仍在变动

作者: Fortune Crypto·

要点速览

  • OpenAI 在 9 月 3 日发布并重新发布公告博客文章后修改了多项 GPT-6 Astra 基准数据,其中一些修改显示 Astra 表现更好,而竞争对手 Anthropic 的模型显得更差。
  • Astra 报告的幻觉率一度从 4.2% 降至 2%,随后又回到原始数字;在禁运草案中 Astra 的 ARC-AGI-3 得分为 98.6%,而在在线博客中升至 99.99%。
  • OpenAI 的 ARC-AGI-3 结果在很大程度上取决于配置:Arc Prize Foundation 独立测得使用强大 harness 时为 99.9%,使用标准 harness 时为 63%。
  • OpenAI 表示评估数字存在几个百分点的噪声,其修改是为了反映对模型性能的最佳估计,而一些专家则对行业性的“刷分(benchmaxxing)”行为表示担忧。
  • 不断变化且令人困惑的基准数据可能使客户和投资者更难评估哪些 AI 模型擅长哪些任务,尤其是在 OpenAI 可能于 2027 年 IPO 之际。
OpenAI 在 GPT-6 Astra 发布后悄然修改多项基准评分,部分数据仍在变动

自 9 月 3 日下午首次发布 GPT-6 Astra 模型公告博客文章以来,OpenAI 已修改了该模型的多个评估基准。在某些情况下,更新后的数据显示 Astra 表现更好,而 OpenAI 主要竞争对手 Anthropic 的模型得分则显得更差。

这些修改发生在博客文章异常曲折的发布过程中。OpenAI 原计划让文章于美国东部时间下午 2 时上线,但过了将近两个小时,该文章才得以在网上广泛访问。

当天下午 3 时 32 分,OpenAI 的 X 账号分享该博客文章时,链接无法正常加载,返回错误信息。下午 3 时 50 分,OpenAI 首席执行官 Sam Altman 发布了该链接,并写道:“我们在部署博客文章时遇到了一点小麻烦,但它真的很棒。”多位评论者仍无法查看该页面,并收到同样的错误,Fortune 也遇到了同样情况。约一小时后 Fortune 再次查看时,该文章已可见并能正常加载。

事后得知,OpenAI 实际上在下午 2 时刚过就发布了该博客,但随后将其撤回,原因该公司称无法透露,同时表示这些原因与基准性能数据无关。(OpenAI 起初告诉 Fortune 这是内容管理系统的 bug,后来又称是一次互联网故障。)重新发布后,博客中包含了一些似乎有利于 Astra 的不同评估指标——此后部分数据仍在继续变化。这些修改通过互联网存档快照得到记录,快照会在特定时间点捕获页面,使人们可以比较文章的早期版本与后期版本。

这些修改的曝光正值 AI 行业激烈竞争之际,各公司以极快的节奏发布大语言模型更新,力图超越对手。对指标的关注也凸显了用标准化基准测试衡量大语言模型性能的难度,以及人们对这类规范容易被操纵和玩弄的担忧。

“我们非常重视把评估做对,”OpenAI 发言人对 Fortune 表示。“大多数评估都会因报告所使用的确切检查点、脚手架和评估运行而产生几个百分点的噪声。在我们的发布博客中,我们进行了修正,以确保这些数字代表我们对可用模型性能的最佳估计,从而让用户能够进行有意义的比较。”

首发版本与最终发布版本之间的差异——数字仍在变化

最显著的变化之一涉及 Astra 报告的幻觉率。在美国东部时间下午 2 时 23 分的博客文章首张互联网存档快照中,该数字为 4.2%。在随后的多张快照中,这一数字保持不变,最后一张是下午 3 时 11 分的第五张快照——大约在 OpenAI 推出最终版本前 10 分钟。

但在下午 5 时 20 分拍摄的第六张存档快照中——此时博客应该已对所有人可见——幻觉率连同另外四项指标发生了变化。Astra 的幻觉率被减半至 2%。Astra 前代模型 GPT-5.6 Sol 的得分也从 12.2% 降至 9.4%。OpenAI 此后继续修改这一指标;截至本文撰写时,幻觉率已回升至最初的 4.2% 和 12.2%。

OpenAI 似乎还在其内部版本的 ExploitBench 网络安全评估中大幅提升了 GPT-5.6 Sol 的得分,从首版的 5.5% 升至后续版本的 11.5%。OpenAI 表示,目前正在调查将该数字回退至 5.5%,因为其称 11.5% 的结果反映了 Sol 尚未商业提供的推理水平。

OpenAI 表示,Astra 尤其擅长数学——公司在公告页面的开头段落强调了这一特质。虽然该指标在快照中对 Astra 并未变化——在 FrontierMath Tier 4 (v2) 评估中保持在 97.6%——但 OpenAI 确实短暂修改了 GPT-5.6 Sol 和 Anthropic 最新模型 Fable 5.1 的得分。这些变化曾使 Astra 在数学方面显得明显优于这两个模型。

在首张快照(9 月 3 日下午 2 时 23 分)中,Anthropic 的 Fable 5.1 得分为 87.8%。到下午 5 时 17 分,该分数下降了近 10 个百分点,至 78%。如今,它已回升至 83%。类似地,GPT-5.6 Sol 的得分从 83% 降至 80.5%,如今又回到 83%。

指标的变化甚至在 OpenAI 于下午 2 时首次发布博客之前就已开始。该公司向 Fortune 及其他媒体机构提供的发布前禁运草案中,Astra 在 ARC-AGI-3 评估中的得分为 98.6%。而在现在的在线博客中,该数字为 99.99%。

“我们在发布前始终会验证评估,因此草案版本与最终版本之间的调整是正常的,”公司发言人当时表示。OpenAI 还指出,该基准的创建方 Arc Prize Foundation 在其独立评估中发现,若为模型配备特别强大的 harness(即模型可用于完成任务的一组工具),Astra 的表现为 99.9%。若使用该基准的标准 harness,其表现为 63%——仍显著优于当前公开发布的任何其他 AI 模型。OpenAI 表示“harness、推理水平等因素都会影响评估结果”。ARC-AGI-3 两个数字之间的差距说明,一个头条数字在很大程度上取决于产生它的测试配置。

“刷分”——还是提高准确性?

OpenAI 内部不同的研究团队负责不同的指标,负责计算并向中央团队报告以供发布。OpenAI 坦承这些数字是在最佳条件下取得的,可能与大多数用户使用的 ChatGPT 生产版本中的模型略有不同。博客上的一段免责声明写道:“评估得分为任意努力程度下的最大值。”公司还在脚注中对每项指标作了进一步说明。

准确性难以捉摸,因为根据测试运行条件的不同,多个数字都可能被视为准确。但一些 AI 专家质疑其中是否也存在“刷分(benchmaxxing)”行为。这是 AI 行业——不仅限于 OpenAI——的一种已知做法,即通过在不同条件下重新运行评估来最大化得分。

“这可以在非常短的时间内完成,而且对他们的营销更有利,”斯坦福智能系统实验室和斯坦福可信 AI 实验室的研究人员 Anka Reuel 和 Mike Hardy 表示。他们还指出,GPT-6 Astra 系统卡本应包含关于评估如何进行的更多技术信息,但并不总是能妥善解释这些内容。例如,对于内部幻觉基准,系统卡“几乎没有提供关于该评估的任何细节”,他们说,“甚至没有包括测试项目的数量。”

这种对数字的反复重跑或许可以解释为何 Astra 的编程能力在博客文章的后续版本中也获得了微弱提升,从 57.7% 升至 57.9%。尽管差异微不足道,OpenAI 似乎仍足够在意,换上了这个更新、更高的数字。

并非 OpenAI 的所有修改都对 Astra 更有利。例如,在面向医疗健康领域的 HealthBench Professional 评估的不同版本中,Anthropic 两项模型得分有所提升:Claude Fable 5.1 从 56.6% 升至 58.1%,Opus 5 从 54.5% 升至 56.4%。其他 AI 公司模型的得分通常取自已发布的排行榜,并不涉及 OpenAI 自行对竞争对手的模型运行评估。

评估得分之争困扰 AI 行业

基准准确性的问题过去已多次浮出水面。2025 年,Meta 否认了有关其通过发布内部版本(而非公开发布版本)的 Llama 4 模型结果来人为抬高得分的报道。Meta 前首席 AI 科学家 Yann LeCun 后来承认该公司“篡改”了基准结果。评估指标也会随着新指标的产生而频繁变化。例如,ExploitGym——这一在 7 月 OpenAI 模型失控攻击 Hugging Face 公司事件中处于核心的网络安全基准——创建于 2026 年。

Snorkel AI 负责基准与评估研究的 AI 工程师 Vincent Sunn Chen 表示,基准得分在模型上线前的最后几小时发生变动并不罕见。“这通常是最终上线流程的函数,”他在一封电子邮件中说。“基准得分反映的是特定的测量设置:模型检查点、配置(包括允许模型使用的时间和算力)、harness、评估/评分配置(例如评判中的非确定性)。所有这些在上线前的最后几天通常仍在变动,所以出现一些更新我并不意外。”他表示,希望业界形成规范,要求公司在修改基准性能数字时报告评估发生了哪些变化,以便研究人员更清晰地解读结果。

基准结果之所以重要,有多个原因。它们是 AI 公司衡量进步的方式,也是在与竞争对手竞赛中记分的方式。在这些评估中登上排行榜榜首可以帮助 AI 公司赢得客户,在某些情况下还有助于招聘工程师和研究人员。然而,正如这一事件所表明的,解读基准得分在技术上可能相当复杂,这对希望以易于消化的形式向公众展示结果的公司构成了挑战。这些复杂性,加上对不断变化的指标的困惑,以及有关公司在呈现结果时缺乏学术诚实的指责,可能使客户和投资者更难准确判断哪些模型最适合哪些任务。这种困惑也可能搅浑“拥有市场上最佳模型”的叙事——在可能的 2027 年 IPO 之前,OpenAI 无疑希望呈现这样的叙事。

本文最初发表于 Fortune.com。