Epoch AI 的遊戲解謎基準測試讓頂尖 AI 模型卡在 60% 以下,暴露推理能力差距
重點速覽
- •Epoch AI 推出了兩項各包含 100 道程式化生成謎題的基準測試,旨在防止記憶並衡量真實推理能力,不允許使用代理框架、思維鏈提示或工具呼叫。
- •在神秘遊戲解謎中,表現最佳的模型僅達 59%,而開源權重模型停滯在 38%,揭示了閉源與開源權重系統在推理密集型任務上的顯著差距。
- •西洋棋解謎的性能從 2025 年 12 月推出時 GPT-5 的 37% 提升至後續模型版本的 54%,顯示出可衡量但仍不完整的獨立推理進展。
- •一項名為 EBR-bench 的相關評測顯示,截至 2026 年 7 月,AI 在從重複互動中學習的進展有限,進一步印證互動式推理仍是持續存在的挑戰。
- •開源權重模型與閉源模型之間的性能差異引發了疑問:僅靠架構改進能否彌合推理差距,抑或是專有訓練方法發揮了決定性作用。

Epoch AI 是一所非營利研究機構,推出了兩款遊戲導向的評測工具——神秘遊戲解謎與西洋棋解謎——旨在嚴格測試頂尖人工智慧模型的推理能力。初步結果顯示,現今的 AI 系統在處理全新問題情境方面存在顯著限制,而此結論發表之際,多家前沿實驗室正日益以推理與規劃能力作為行銷最新模型的核心賣點。
最引人注目的結果:在神秘遊戲解謎基準測試中,最高得分僅為 59%,而開源權重模型最高只達到 38%。
基準測試的運作方式
每項基準測試包含 100 道程式化生成的謎題。西洋棋解謎採用相對傳統的形式——在給定的特定棋盤局面下,模型須找出最佳走法。
神秘遊戲解謎則採取根本不同的方式。在此版本中,AI 不會被告知它正在玩哪種遊戲。遊戲的身分被刻意隱藏,從而消除對記憶模式或訓練資料捷徑的任何依賴。此設計直接針對 Epoch AI 所指出的傳統 AI 基準測試汙染問題——模型通常在包含其評測測試的網路資料集上進行訓練。
隨著 MMLU 和 GSM8K 等廣泛使用的基準測試中頂尖分數趨近天花板,使其區分領先模型的能力日益受限,此汙染問題變得更加迫切。能夠抵抗記憶的評測工具日益稀缺,使程式化生成的測試對於真實的能力評估變得更加珍貴。
透過程式化生成謎題並隱藏遊戲格式,Epoch AI 移除了模式識別的安全網,迫使模型展現真正的空間推理與規劃能力。
回答以標準化走棋記譜法對照既定答案庫進行評分。基準測試不允許使用代理框架、思維鏈提示技巧或工具呼叫。
目前性能結果
在神秘遊戲解謎中,沒有模型超過 59%。開源權重模型在 38% 處停滯,凸顯了前沿閉源系統與開源權重對應版本之間顯著的性能差距。
西洋棋解謎呈現出略為樂觀的景象。GPT-5 在 2025 年 12 月基準測試推出時錄得 37% 的分數。後續發布的模型版本已將該數字提升至 54%,反映出在相對壓縮的時間框架內有可衡量的進步。
然而,即便是 54% 的西洋棋解謎成績也凸顯了一個關鍵區別:借助搜尋工具下西洋棋的熟練度,與獨立推理陌生局面根本不同。傳統西洋棋引擎如 Stockfish 透過窮舉搜尋樹和評估函數實現超人水準的對弈,而非透過語言模型預期展現的通用推理能力。一個在沒有工具的情況下獲得 54% 的模型,所依據的衡量標準與引擎輔助對弈根本不同。
兩項基準測試似乎都未接近飽和——在許多既有 AI 評測已無法有效區分前沿模型的當下,這是一個值得注意的特性。
更廣泛的影響
Epoch AI 營運一個更廣泛的基準測試中心,其中包括 Epoch 能力指數(ECI),該指數匯總了數學、程式編寫和遊戲方面的模型評估結果。ECI 的設計目的是在無需依賴任何單一測試的情況下,提供快速的能力估算。
一項名為 EBR-bench 的相關評測,以遊戲 Earthborne Rangers 為基礎,截至 2026 年 7 月顯示 AI 在從重複互動中學習的進展有限。此結果強化了互動式推理仍是 AI 系統持續面臨之挑戰的觀察。
西洋棋解謎在數個月內從 37% 提升至 54%,顯示進步仍在繼續。然而,神秘遊戲的結果表明,通用推理能力的進展速度低於 AI 公司的宣傳材料所暗示的步伐。
開源權重模型與閉源模型在推理密集型任務上 38% 對 59% 的差距,凸顯了切實的競爭落差。對於依賴開源模型的去中心化 AI 專案而言,此性能差異代表了一種結構性劣勢,僅靠增加運算基礎設施不太可能解決。此差距也引發了疑問:開源權重開發是否能僅透過架構改進來彌合推理落差,抑或是專有訓練方法和資料篩選發揮了當前開源授權無法複現的決定性作用。