ActualitésMacroLes données d'Arena AI montrent que l'écart entre modèles de pointe fermés et modèles à poids ouverts se creuse à 29 points Elo

Les données d'Arena AI montrent que l'écart entre modèles de pointe fermés et modèles à poids ouverts se creuse à 29 points Elo

Auteur: CryptoBriefing·

Points clés

  • Selon les données d'évaluation d'Arena AI, l'écart de notation Elo entre les meilleurs modèles d'IA fermés et à poids ouverts est passé de zéro en janvier 2025 à 29 points en septembre 2026.
  • L'analyse d'Epoch AI montre que les modèles à poids ouverts accusent désormais environ quatre mois de retard sur les modèles fermés pour les tâches les plus exigeantes, contre trois mois fin 2025.
  • Arena, née d'un projet de recherche de l'UC Berkeley en 2023, a atteint 100 millions de dollars de revenus annualisés en huit mois après le lancement de ses services d'évaluation payants.
  • L'essentiel du développement des modèles à poids ouverts de pointe provient désormais de laboratoires chinois comme Moonshot AI, Zhipu, DeepSeek et Alibaba, tandis que les responsables politiques américains et européens débattent de restrictions sur les publications de poids ouverts au-delà de certains seuils de capacité.
  • Cet écart croissant confronte les entreprises et les gouvernements qui privilégient le contrôle des données et la conformité réglementaire à un arbitrage accru entre souveraineté et performance brute des modèles.
Les données d'Arena AI montrent que l'écart entre modèles de pointe fermés et modèles à poids ouverts se creuse à 29 points Elo

En janvier 2025, les modèles d'IA à poids ouverts avaient brièvement atteint la parité avec leurs rivaux à code source fermé, l'écart de notation Elo sur le classement participatif d'Arena tombant à zéro. Ce moment est révolu. En septembre 2026, l'écart entre les meilleurs modèles fermés de pointe et leurs principaux concurrents à poids ouverts s'est creusé pour atteindre 29 points Elo, selon les données d'évaluation d'Arena AI.

Claude Opus 5 Max affiche actuellement une note de 1505, tandis que le Kimi K3 Max de Moonshot AI, le concurrent à poids ouverts le plus solide, accuse près de 30 points de retard. Peter Gostev, responsable des capacités IA d'Arena, a joué un rôle central dans le suivi et la visualisation de cette divergence.

Les enjeux de cet écart dépassent largement les classements. Les modèles à poids ouverts — dont les paramètres peuvent être téléchargés et exécutés sur l'infrastructure propre du client — séduisent les entreprises et les gouvernements qui privilégient le contrôle des données, la conformité réglementaire et l'évitement des frais d'API au token. Un écart de capacités qui se creuse signifie que ces organisations sont de plus en plus confrontées à un arbitrage entre souveraineté et performance brute. Inversement, le retard d'environ quatre mois signifie que les utilisateurs de modèles à poids ouverts obtiennent des capacités que les modèles fermés proposent déjà, simplement avec un décalage.

Ce que les chiffres révèlent réellement

La trajectoire est plus révélatrice que n'importe quel instantané. De zéro en janvier 2025 à 29 points en septembre 2026, la tendance s'éloigne de la parité pour les modèles à poids ouverts. L'analyse d'Epoch AI confirme ce constat sous un autre angle : les modèles à poids ouverts accusent désormais environ quatre mois de retard sur leurs homologues fermés en performance sur les tâches les plus exigeantes, contre un retard de trois mois observé jusqu'à fin 2025.

Arena traite plus de 10 millions d'évaluations par mois, en s'appuyant sur un vaste ensemble d'interactions réelles d'utilisateurs plutôt que sur des benchmarks synthétiques. C'est important, car les benchmarks statiques ont repeatedly été critiqués pour contamination — des données de test qui fuient dans les ensembles d'entraînement — et pour leur incapacité à saisir le comportement des modèles face à des requêtes réelles et désordonnées. Quand des millions d'utilisateurs anonymes préfèrent systématiquement les sorties d'un modèle à celles d'un autre, ce signal est difficile à écarter.

Les points Elo eux-mêmes demandent également une interprétation : un écart de 29 points sur l'échelle d'Arena ne signifie pas que les modèles fermés sont catégoriquement meilleurs dans tous les domaines. Des modèles peuvent être proches globalement tout en présentant des écarts importants sur des types de tâches spécifiques, ce qui explique l'attention portée au travail de Gostev sur les ventilations par capacité.

L'économie de la mesure de l'IA

Arena est elle-même devenue une belle success story entrepreneuriale. Née d'un projet de recherche de l'UC Berkeley en 2023, la plateforme est devenue une entreprise générant 100 millions de dollars de revenus annualisés, atteignant ce rythme en seulement huit mois après le lancement de ses services d'évaluation payants. Sa monétisation traduit un signal de demande plus large : à mesure que les entreprises investissent massivement dans l'IA, elles sont prêtes à payer pour une mesure indépendante, fondée sur les préférences humaines, des performances réelles des modèles.

La contribution de Gostev a porté sur la lisibilité des faiblesses des modèles. Ses travaux mettent en évidence la tension entre les performances des modèles évalués par des experts du domaine et celles évaluées par des utilisateurs généralistes, une distinction qui compte considérablement pour les déploiements en entreprise — le favori d'un classement d'utilisateurs généralistes n'est pas nécessairement le meilleur modèle pour, par exemple, des travaux juridiques ou médicaux.

La géopolitique des modèles ouverts

Le développement le plus actif des modèles à poids ouverts s'est largement déplacé vers les laboratoires chinois. La série Kimi de Moonshot AI, le GLM de Zhipu, DeepSeek et le Qwen d'Alibaba représentent l'état de l'art de ce qui est publiquement disponible. Cela a un poids politique : aux États-Unis et en Europe, les publications de modèles à poids ouverts sont débattues dans le cadre des projets de réglementation de l'IA, certains responsables politiques plaidant pour restreindre les poids ouverts au-delà de certains seuils de capacité. Parallèlement, la plupart des publications de modèles à poids ouverts de pointe proviennent désormais de Chine, ce qui signifie que la frontière publiquement inspectable de l'IA est de plus en plus façonnée par des décisions d'ingénierie chinoises et des conditions de licence. Pourtant, l'écart persiste, tandis qu'Anthropic, OpenAI et Google DeepMind continuent de faire progresser leurs modèles fermés plus loin et plus vite.

La question ouverte à l'avenir est de savoir si le retard de quatre mois se maintiendra, se creusera ou se réduira — la réponse façonnera les décisions d'achat des organisations qui ont parié sur une infrastructure ouverte, ainsi que le pouvoir de négociation sur les prix que conserveront les fournisseurs de modèles fermés.