新闻宏观经济Arena AI 数据显示:前沿闭源模型与开放权重 AI 模型差距扩大至 29 个 Elo 积分

Arena AI 数据显示:前沿闭源模型与开放权重 AI 模型差距扩大至 29 个 Elo 积分

作者: CryptoBriefing·

要点速览

  • 根据 Arena AI 评测数据,最好的闭源与开放权重 AI 模型之间的 Elo 评分差距从 2025 年 1 月的零扩大至 2026 年 9 月的 29 分。
  • Epoch AI 分析显示,开放权重模型在最具挑战性的任务上目前落后闭源模型约四个月,高于 2025 年底观察到的三个月。
  • Arena 于 2023 年作为加州大学伯克利分校研究项目起步,在推出付费评测服务八个月内达到 1 亿美元年化收入。
  • 大多数前沿开放权重模型开发如今来自中国实验室,包括 Moonshot AI、智谱、DeepSeek 和阿里巴巴,与此同时美欧政策制定者正辩论对超过特定能力阈值的开放权重发布加以限制。
  • 差距扩大意味着优先考虑数据控制和监管合规的企业与政府面临主权与原始模型性能之间日益加剧的权衡。
Arena AI 数据显示:前沿闭源模型与开放权重 AI 模型差距扩大至 29 个 Elo 积分

2025 年 1 月,开放权重 AI 模型曾短暂追平其闭源对手,Arena 众包排行榜上的 Elo 评分差距降至零。那一刻已经过去。根据 Arena AI 的评测数据,截至 2026 年 9 月,最好的闭源前沿模型与其最强开放权重竞争者之间的差距已扩大至 29 个 Elo 积分。

Claude Opus 5 Max 目前评分为 1505,而最强的开放权重选手——Moonshot AI 的 Kimi K3 Max——落后近 30 分。Arena 的 AI 能力负责人 Peter Gostev 一直在跟踪和可视化这一分化趋势。

这一差距的影响远不止排行榜。开放权重模型的参数可以被下载并在客户自己的基础设施上运行,因此对优先考虑数据控制、监管合规以及避免按 token 计费 API 费用的企业和政府具有吸引力。能力差距的扩大意味着有这些需求的组织日益面临主权与原始性能之间的权衡。反过来,约四个月的滞后意味着开放权重用户获得的只是闭源模型早已提供的能力,只是有所延迟。

这些数字究竟意味着什么

发展趋势比任何单一快照都更具揭示性。从 2025 年 1 月的零差距到 2026 年 9 月的 29 分,趋势正远离开放权重模型的持平目标。Epoch AI 的分析从另一个角度印证了这一图景:在最具挑战性的任务上,开放权重模型目前落后闭源对手约四个月,高于 2025 年底观察到的三个月。

Arena 每月处理超过 1000 万次评测,依托大量真实用户互动,而非合成基准测试。这一点很重要,因为静态基准测试屡屡因数据污染——测试数据泄漏进训练集——以及无法捕捉模型在混乱的真实提示下的表现而受到批评。当数百万匿名用户持续偏好某一个模型的输出而非另一个时,这一信号很难被忽视。

Elo 积分本身也需要解读:Arena 量表上 29 分的差距并不意味着闭源模型在所有方面都绝对更好。模型可能在总体上接近,却在特定任务类型上存在巨大差异,这也是 Gostev 按能力细分的工作受到关注的原因。

衡量 AI 的生意

Arena 本身已成为一个引人注目的商业故事。它于 2023 年作为加州大学伯克利分校的研究项目起步,如今已成长为一家年化收入达 1 亿美元的企业,在推出付费评测服务仅八个月内便达到这一运行率。其变现模式反映了一种更广泛的需求信号:随着企业向 AI 投入大量预算,它们愿意为基于人类偏好的独立测量付费,以了解哪些模型真正有效。

Gostev 的贡献集中于让模型的弱点清晰可读。他的工作凸显了模型在领域专家评测与普通用户评测下表现之间的张力——这一区分对企业部署意义重大:普通用户排行榜上的宠儿未必是法律或医疗等领域的最佳模型。

开放模型的地缘政治

最活跃的开放权重模型开发已大幅转向中国实验室。Moonshot AI 的 Kimi 系列、智谱的 GLM、DeepSeek 以及阿里巴巴的 Qwen 代表了公开可得的前沿水平。这具有政策分量:在美国和欧洲,开放权重发布正被纳入拟议中的 AI 监管讨论,一些政策制定者主张对超过特定能力阈值的开放权重加以限制。与此同时,大多数前沿开放权重发布如今源自中国,这意味着 AI 可公开审查的前沿正日益由中国的工程决策和许可条款塑造。然而差距依然存在,因为 Anthropic、OpenAI 和 Google DeepMind 继续以更快速度推进其闭源模型。

未来的悬而未决的问题是,这四个月的滞后是保持不变、进一步扩大还是缩小——答案将影响押注开放基础设施的组织的采购决策,以及闭源模型提供商在定价上保留多少筹码。