Les benchmarks de puzzles de jeux d'Epoch AI plafonnent les meilleurs modèles d'IA sous les 60 %, révélant des lacunes en raisonnement
Points clés
- •Epoch AI a publié deux benchmarks comprenant chacun 100 puzzles générés programmatiquement, conçus pour empêcher la mémorisation et mesurer un raisonnement authentique sans autoriser l'échafaudage d'agents, la sollicitation en chaîne de pensée ou l'utilisation d'outils.
- •Sur les Mystery Game Puzzles, le modèle le plus performant n'a atteint que 59 % tandis que les modèles à poids ouverts plafonnaient à 38 %, révélant un écart significatif entre les systèmes à code source fermé et à poids ouverts sur les tâches à forte intensité de raisonnement.
- •Les performances aux Chess Puzzles se sont améliorées, passant de 37 % avec GPT-5 au lancement en décembre 2025 à 54 % avec les versions de modèles ultérieures, indiquant des progrès mesurables mais encore incomplets en raisonnement autonome.
- •Une évaluation associée appelée EBR-bench a montré une amélioration limitée de l'IA dans l'apprentissage à partir d'interactions répétées en juillet 2026, renforçant le constat selon lequel le raisonnement interactif reste un défi persistant.
- •Le différentiel de performance entre les modèles à poids ouverts et les modèles à code source fermé soulève la question de savoir si de seules améliorations d'architecture peuvent combler l'écart de raisonnement ou si les méthodologies d'entraînement propriétaires jouent un rôle décisif.

Epoch AI, un institut de recherche à but non lucratif, a présenté deux outils d'évaluation basés sur des jeux — Mystery Game Puzzles et Chess Puzzles — visant à tester rigoureusement les capacités de raisonnement des principaux modèles d'intelligence artificielle. Les résultats initiaux révèlent des limitations significatives dans la capacité des systèmes d'IA actuels à traiter des scénarios de résolution de problèmes inédits, un constat qui arrive alors que plusieurs laboratoires de frontière commercialisent de plus en plus leurs derniers modèles autour de la compétence en raisonnement et en planification.
Le résultat marquant : le score le plus élevé obtenu sur le benchmark Mystery Game Puzzles n'est que de 59 %, tandis que les modèles à poids ouverts n'atteignent pas plus de 38 %.
Fonctionnement des benchmarks
Chaque benchmark comprend 100 puzzles générés programmatiquement. Les Chess Puzzles suivent un format relativement conventionnel — étant donné une position spécifique sur l'échiquier, le modèle doit identifier le meilleur coup.
Les Mystery Game Puzzles adoptent une approche fondamentalement différente. Dans cette variante, l'IA ne sait pas à quel jeu elle joue. L'identité du jeu est délibérément dissimulée, éliminant toute dépendance à des motifs mémorisés ou à des raccourcis issus des données d'entraînement. Cette conception répond directement à ce qu'Epoch AI identifie comme un problème de contamination dans les benchmarks d'IA traditionnels, où les modèles s'entraînent souvent sur des ensembles de données Internet qui incluent les tests mêmes utilisés pour les évaluer.
Cette préoccupation de contamination est devenue plus pressante à mesure que des benchmarks largement utilisés tels que MMLU et GSM8K ont vu leurs meilleurs scores se regrouper près du plafond, réduisant leur capacité à différencier les modèles de pointe. Les évaluations qui résistent à la mémorisation sont devenues rares, rendant les tests générés programmatiquement de plus en plus précieux pour une évaluation honnête des capacités.
En générant les puzzles programmatiquement et en obscurcissant le format du jeu, Epoch AI supprime le filet de sécurité de la reconnaissance de motifs, contraignant les modèles à faire preuve de véritables capacités de raisonnement spatial et de planification.
Les réponses sont évaluées à l'aide d'une notation de coups normalisée, mesurée par rapport à une grille de réponses établie. Les benchmarks n'autorisent ni l'échafaudage d'agents, ni les techniques de sollicitation en chaîne de pensée, ni l'utilisation d'outils.
Résultats de performance actuels
Sur les Mystery Game Puzzles, aucun modèle n'a dépassé 59 %. Les modèles à poids ouverts plafonnent à 38 %, soulignant un écart de performance notable entre les systèmes à code source fermé de pointe et leurs homologues à poids ouverts.
Les Chess Puzzles présentent un tableau quelque peu plus encourageant. GPT-5 a obtenu un score de 37 % lorsque le benchmark a été introduit en décembre 2025. Les versions de modèles ultérieures ont depuis porté ce chiffre à 54 %, reflétant une amélioration mesurable dans un délai relativement court.
Cependant, même le résultat de 54 % aux Chess Puzzles souligne une distinction critique : la maîtrise des échecs avec accès à des outils de recherche est fondamentalement différente du raisonnement à travers des positions inconnues de manière autonome. Les moteurs d'échecs traditionnels tels que Stockfish atteignent un jeu surhumain grâce à des arbres de recherche exhaustifs et à des fonctions d'évaluation, et non par le type de raisonnement généralisé que les modèles de langage sont censés démontrer. Un modèle obtenant 54 % sans outils est mesuré selon un standard fondamentalement différent du jeu assisté par moteur.
Aucun des deux benchmarks ne semble approcher de la saturation — une propriété notable à une époque où de nombreuses évaluations d'IA établies ne peuvent plus distinguer de manière significative les modèles de pointe les uns des autres.
Implications plus larges
Epoch AI exploite un hub de benchmarking plus vaste qui inclut l'Epoch Capabilities Index (ECI), qui regroupe les évaluations de modèles en mathématiques, programmation et jeu. L'ECI est conçu pour fournir des estimations rapides des capacités sans dépendre d'un seul test.
Une évaluation associée appelée EBR-bench, basée sur le jeu Earthborne Rangers, a montré une amélioration limitée de l'IA dans l'apprentissage à partir d'interactions répétées en juillet 2026. Ce résultat renforce l'observation selon laquelle le raisonnement interactif reste un défi persistant pour les systèmes d'IA.
La progression de 37 % à 54 % aux Chess Puzzles sur plusieurs mois indique que les progrès se poursuivent. Pourtant, les résultats des Mystery Games suggèrent que le raisonnement généralisé progresse à un rythme plus lent que ne le laissent entendre les documents promotionnels des entreprises d'IA.
L'écart de 38 % contre 59 % entre les modèles à poids ouverts et les modèles à code source fermé sur les tâches à forte intensité de raisonnement met en évidence une disparité compétitive tangible. Pour les projets d'IA décentralisée qui dépendent de modèles ouverts, ce différentiel de performance représente un désavantage structurel que la seule addition d'infrastructures de calcul supplémentaires est peu susceptible de résoudre. L'écart soulève également la question de savoir si le développement à poids ouvert peut combler le déficit de raisonnement par de seules améliorations d'architecture, ou si les méthodologies d'entraînement propriétaires et la curation des données jouent un rôle décisif que les licences ouvertes actuelles ne peuvent pas répliquer.