Epoch AI游戏谜题基准测试让顶级AI模型卡在60%以下,暴露推理能力差距
要点速览
- •Epoch AI发布了两款基准测试,各包含100个程序化生成的谜题,旨在防止记忆化并衡量真实推理能力,不允许使用智能体脚手架、思维链提示或工具调用。
- •在Mystery Game Puzzles上,表现最好的模型仅达到59%,而开源权重模型停滞在38%,揭示了闭源系统与开源权重系统在推理密集型任务上的显著差距。
- •国际象棋谜题性能从2025年12月发布时GPT-5的37%提升至后续模型发布的54%,表明独立推理方面有可衡量但仍不完整的进步。
- •一项名为EBR-bench的相关评估显示,截至2026年7月,AI在从重复交互中学习方面改进有限,进一步证实交互式推理仍是一个持续性挑战。
- •开源权重模型与闭源模型之间的性能差异引发了关于仅靠架构改进是否能缩小推理差距,还是专有训练方法发挥了决定性作用的疑问。

非营利研究机构Epoch AI推出了两款基于游戏的评估工具——Mystery Game Puzzles和Chess Puzzles,旨在严格测试领先人工智能模型的推理能力。初步结果揭示了当今AI系统在处理新型问题解决场景方面的显著局限性,这一结果发布的背景是多个前沿实验室越来越多地以推理和规划能力作为其最新模型的卖点。
最引人注目的结果是:在Mystery Game Puzzles基准测试中,最高得分仅为59%,而开源权重模型最高不超过38%。
基准测试的工作原理
每款基准测试包含100个程序化生成的谜题。Chess Puzzles采用相对常规的格式——给定特定棋盘局面,模型需要找出最佳走法。
Mystery Game Puzzles采取了根本不同的方法。在这个变体中,AI不会被告知它在玩什么游戏。游戏身份被刻意隐藏,消除了对记忆化模式或训练数据捷径的任何依赖。这一设计直接解决了Epoch AI所指出的传统AI基准测试中的数据污染问题,即模型通常在包含其评估测试本身的互联网数据集上进行训练。
这一污染问题随着MMLU和GSM8K等广泛使用的基准测试的顶级得分逐渐接近满分而变得更加紧迫,削弱了它们区分领先模型的能力。能够抵抗记忆化的评估工具变得稀缺,使程序化生成的测试在诚实的能力评估中愈发重要。
通过程序化生成谜题并隐藏游戏格式,Epoch AI消除了模式识别的安全网,迫使模型展现真实的空间推理和规划能力。
模型回答通过标准化的走法记号与既定答案库对照进行评分。基准测试不允许使用智能体脚手架、思维链提示技巧或工具调用。
当前性能结果
在Mystery Game Puzzles上,没有模型超过59%。开源权重模型停滞在38%,突显了前沿闭源系统与开源权重对应物之间显著的性能差距。
Chess Puzzles呈现出略微更令人鼓舞的画面。GPT-5在2025年12月基准测试推出时录得37%的得分。后续发布的模型已将这一数字提升至54%,反映了在相对紧凑的时间段内的可测量进步。
然而,即使是54%的国际象棋谜题结果也突出了一个关键区别:借助搜索工具下国际象棋的熟练程度,与独立推理陌生棋局的能力存在根本差异。Stockfish等传统国际象棋引擎通过穷举搜索树和评估函数实现超人类水平的对弈,而非通过语言模型被期望展现的那种通用推理能力。一个在没有工具的情况下得分54%的模型,所依据的标准与引擎辅助对弈有着根本不同。
两款基准测试均未显示出接近饱和的迹象——在许多既有AI评估已无法有效区分前沿模型的当下,这一特性尤为值得关注。
更广泛的影响
Epoch AI运营着一个更广泛的基准测试平台,其中包括Epoch Capabilities Index(ECI),该指数汇总了数学、编程和游戏玩法方面的模型评估结果。ECI旨在不依赖任何单一测试的情况下提供快速的能力估算。
一项名为EBR-bench的相关评估基于游戏Earthborne Rangers,截至2026年7月显示AI在从重复交互中学习方面的改进有限。这一结果强化了交互式推理仍然是AI系统面临的一个持续性挑战的观察。
几个月内国际象棋谜题从37%升至54%的进步表明,进展仍在继续。然而,神秘游戏的结果表明,通用推理能力的进步速度慢于AI公司宣传材料所暗示的水平。
开源权重模型与闭源模型在推理密集型任务上38%对59%的差距,凸显了一种切实的竞争劣势。对于依赖开源模型的去中心化AI项目而言,这种性能差异代表了一种结构性劣势,仅靠增加计算基础设施不太可能解决。这一差距还引发了关于开源权重开发是否能仅通过架构改进来弥补推理缺陷,还是专有训练方法和数据策展发挥了当前开源许可无法复制的决定性作用的疑问。