Arena AIデータ、フロンティアモデルとオープンウェイトモデルの格差が29 Eloポイントに拡大
重要ポイント
- •Arena AIの評価データによると、最高の閉鎖型モデルとオープンウェイトAIモデルのEloレーティング格差は、2025年1月のゼロから2026年9月時点で29ポイントに拡大した。
- •Epoch AIの分析では、オープンウェイトモデルは最も困難なタスクで閉鎖型モデルに約4か月遅れており、2025年後半まで観測されていた3か月の遅れから拡大している。
- •2023年にUCバークレーの研究プロジェクトとして始まったArenaは、有料評価サービスの開始から8か月で年換算1億ドルの売上に達した。
- •フロンティア級のオープンウェイトモデル開発の大半は現在、Moonshot AI、Zhipu、DeepSeek、Alibabaを含む中国系ラボ発であり、米欧の政策立案者は一定の能力閾値を超えるオープンウェイト公開の制限をめぐり議論している。
- •格差の拡大により、データ管理と規制対応を優先する企業や政府は、主権とモデルの生の性能とのトレードオフにますます直面している。

2025年1月、オープンウェイトAIモデルは一時的に閉鎖型の競合と均衡に達し、Arenaのクラウドソーシング型リーダーボードにおけるEloレーティングの差はゼロとなった。しかしその瞬間は過ぎ去った。Arena AIの評価データによると、2026年9月時点で、最高峰の閉鎖型フロンティアモデルと上位オープンウェイト競合モデルとの格差は29 Eloポイントに拡大している。
Claude Opus 5 Maxは現在1505のレーティングを保持しており、最強のオープンウェイト挑戦者であるMoonshot AIのKimi K3 Maxは約30ポイント差で後塵を拝している。ArenaのAI Capability Leadを務めるPeter Gostev氏は、この乖離の追跡と可視化の中核にいる。
この格差の利害はリーダーボードの域を超える。パラメータをダウンロードして顧客自身のインフラで実行できるオープンウェイトモデルは、データ管理、規制対応、トークン単位のAPI料金の回避を優先する企業や政府にとって魅力的だ。能力格差の拡大は、こうした要件を持つ組織が主権と生の性能のトレードオフにますます直面することを意味する。逆に言えば、約4か月の遅れは、オープンウェイトのユーザーが閉鎖型モデルがすでに提供している能力を、遅れて入手しているにすぎないことも意味する。
数値が実際に意味するもの
その軌跡は単一のスナップショットよりも多くを物語る。2025年1月のゼロから2026年9月の29ポイントへと、トレンドはオープンウェイトモデルにとって均衡から遠ざかる方向に進んでいる。Epoch AIの分析は別の角度からこの状況を裏付けている。オープンウェイトモデルは最も困難なタスクでの性能において閉鎖型モデルに約4か月遅れており、これは2025年後半まで観測されていた3か月の遅れから拡大したものだ。
Arenaは毎月1,000万件以上の評価を処理しており、合成ベンチマークではなく実際のユーザーインタラクションの大規模なプールに依拠している。これが重要なのは、静的なベンチマークが、テストデータの訓練セットへの漏洩(コンタミネーション)や、雑な現実世界のプロンプトに対するモデルの挙動を捉えられないことによって、繰り返し批判されてきたためだ。数百万の匿名ユーザーが一貫してあるモデルの出力を別のモデルより好むとき、そのシグナルは無視しがたい。
Eloポイント自体にも解釈が必要である。Arenaのスケールで29ポイントの差があるからといって、閉鎖型モデルがあらゆる面で断然優れているわけではない。モデルは全体では僅差でありながら、特定のタスクタイプでは大きな差を示すことがあり、それゆえGostev氏の能力別分解に関する仕事が注目を集めている。
AIを測るというビジネス
Arena自体も注目すべきビジネスストーリーとなった。2023年にUCバークレーの研究プロジェクトとして始まったものが、年換算1億ドルの売上を生み出す企業へと成長し、有料評価サービスの開始からわずか8か月でそのランレートに達した。その収益化はより広い需要のシグナルを反映している。企業がAIに予算を注ぎ込むなか、どのモデルが実際に機能するかについて、独立した人間の選好に基づく測定に対して支払う意思があるのだ。
Gostev氏の貢献は、モデルの弱点を判読可能にすることに焦点を当ててきた。彼の仕事は、ドメイン専門家による評価と一般ユーザーによる評価でモデルの性能がどう異なるかという緊張関係を浮き彫りにしており、この区別は企業展開において極めて重要である。一般ユーザーのリーダーボードでの人気モデルが、例えば法務や医療の業務に最適なモデルであるとは限らない。
オープンモデルの地政学
最も活発なオープンウェイトモデル開発は、中国系ラボへと大きくシフトしている。Moonshot AIのKimiシリーズ、ZhipuのGLM、DeepSeek、AlibabaのQwenが、公開されているもののフロンティアを代表する。これには政策的な重みがある。米国と欧州では、オープンウェイトの公開が提案中のAI規制の下で議論されており、一定の能力閾値を超えるオープンウェイトの制限を求める政策立案者もいる。一方、フロンティア級のオープンウェイト公開の大半は今や中国発であり、AIの公開可能な検証可能なフロンティアはますます中国のエンジニアリング上の決定とライセンス条件によって形作られていることを意味する。それでも格差は残り、Anthropic、OpenAI、Google DeepMindは閉鎖型モデルをさらに速く前進させ続けている。
今後の未解決の疑問は、4か月の遅れが維持されるか、さらに拡大するか、それとも縮小するかだ。その答えは、オープンインフラに賭けた組織の調達決定と、閉鎖型モデル提供者が価格で保持する交渉力の大きさを左右するだろう。