Arena AI 數據顯示:頂尖閉源與開放權重 AI 模型差距擴大至 29 個 Elo 積分
重點速覽
- •根據 Arena AI 評測數據,最強閉源與開放權重 AI 模型之間的 Elo 評分差距,從 2025 年 1 月的零擴大至 2026 年 9 月的 29 分。
- •Epoch AI 分析顯示,開放權重模型在最艱鉅任務上目前落後閉源模型約四個月,高於 2025 年底觀察到的三個月。
- •Arena 於 2023 年以 UC Berkeley 研究計畫起家,在推出付費評測服務後八個月內即達到 1 億美元年化營收。
- •多數前沿開放權重模型開發如今來自月之暗面、智譜、DeepSeek 與阿里巴巴等中國實驗室,同時美歐政策制定者正辯論限制超過特定能力門檻的開放權重發布。
- •差距擴大意味著重視資料控制與法規遵循的企業與政府,在主權與原始模型效能之間面臨日益加劇的取捨。

2025 年 1 月,開放權重 AI 模型曾短暫追平閉源競爭對手,Arena 群眾外包排行榜上的 Elo 評分差距一度歸零。但那一刻已成過去。根據 Arena AI 的評測數據,截至 2026 年 9 月,最強閉源前沿模型與頂尖開放權重競爭者之間的差距已擴大至 29 個 Elo 積分。
Claude Opus 5 Max 目前以 1505 分居首,而最強開放權重競爭者、月之暗面(Moonshot AI)的 Kimi K3 Max 落後近 30 分。Arena 的 AI 能力負責人 Peter Gostev 一直是追蹤與視覺化這一分歧的核心人物。
這一差距的影響超越排行榜本身。開放權重模型——其參數可下載並在客戶自家基礎設施上運行——對重視資料控制、法規遵循以及避免按 token 計費 API 費用的企業與政府極具吸引力。能力差距擴大,意味著有這些需求的組織日益面臨主權與原始效能之間的取捨。反之,約四個月的落後意味著開放權重模型用戶獲得的能力,閉源模型早已提供,只是有所延遲。
這些數字實際上意味著什麼
發展軌跡比任何單一快照更能說明問題。從 2025 年 1 月的零差距到 2026 年 9 月的 29 分,趨勢正遠離開放權重模型的持平目標。Epoch AI 的分析從另一角度印證了這一圖景:在最艱鉅的任務上,開放權重模型目前落後閉源模型約四個月,高於 2025 年底觀察到的三個月。
Arena 每月處理超過 1,000 萬次評測,仰賴大量真實用戶互動而非合成基準測試。這一點之所以重要,是因為靜態基準測試屢屢因污染問題——測試資料外洩至訓練集——以及無法反映模型在混亂真實提示下的表現而受到批評。當數百萬匿名用戶持續偏好某一模型的輸出時,這一訊號難以忽視。
Elo 積分本身也需要審慎解讀:在 Arena 的量表上,29 分的差距並不代表閉源模型在所有方面都全面勝出。模型整體可能接近,卻在特定任務類型上表現出巨大差異,這正是 Gostev 的按能力細分分析受到關注的原因。
測量 AI 的商業故事
Arena 本身已成為一則值得關注的商業故事。它於 2023 年以 UC Berkeley 研究計畫起家,如今已發展為年化營收 1 億美元的企業,在推出付費評測服務後僅八個月便達到這一營運規模。其變現模式反映更廣泛的需求訊號:隨著企業大舉投入 AI 預算,他們願意付費取得獨立、基於人類偏好的模型實際表現測量。
Gostev 的貢獻集中於讓模型弱點變得清晰可辨。他的工作凸顯了模型在領域專家評估與一般用戶評估下的表現張力,這一區別對企業部署至關重要——一般用戶排行榜上的寵兒,未必是法律或醫療等領域的最佳模型。
開放模型的地緣政治
最活躍的開放權重模型開發已大幅轉向中國實驗室。月之暗面的 Kimi 系列、智譜的 GLM、DeepSeek 以及阿里巴巴的 Qwen 代表了公開可用的前沿水準。這帶有政策意涵:在美國與歐洲,開放權重模型的發布正納入 AI 監管辯論,部分政策制定者主張限制超過特定能力門檻的開放權重。與此同時,多數前沿開放權重發布如今源自中國,意味著 AI 可公開檢視的前沿日益由中國的工程決策與授權條款塑造。然而差距依然存在,Anthropic、OpenAI 與 Google DeepMind 持續以更快速度推進其閉源模型。
未來的懸念在於四個月的落後會維持、進一步擴大還是縮小——答案將影響押注開放基礎設施的組織的採購決策,以及閉源模型供應商在定價上保留多少籌碼。