ActualitésActionsLe Gemini 3.7 Flash de Google DeepMind se classe 20e au classement Agent Arena

Le Gemini 3.7 Flash de Google DeepMind se classe 20e au classement Agent Arena

Auteur: CryptoBriefing·

Points clés

  • Agent Arena classe les modèles d'IA selon leur performance en direct sur des tâches, en utilisant des données provenant de plus de 1,7 million de sessions utilisateur.
  • Le Gemini 3.7 Flash est passé à la 20e place après avoir enregistré une amélioration de score de 3,4 %.
  • Dix-neuf modèles sont actuellement classés au-dessus du Gemini 3.7 Flash au classement.
  • Le Gemini 3.5 Flash de Google occupe la 27e place, tandis que le Gemini 3.6 Flash se situe autour de la 34e.
  • Le Gemini 3.7 Flash n'a pas été officiellement publié à la mi-août 2026.
Le Gemini 3.7 Flash de Google DeepMind se classe 20e au classement Agent Arena

Le Gemini 3.7 Flash de Google DeepMind a atteint la 20e position du classement Agent Arena, un système de classement en direct exploité par arena.ai qui évalue les modèles d'IA selon leur performance réelle dans l'exécution de tâches. Le modèle a enregistré une amélioration de score de 3,4 %, le plaçant dans un classement conçu pour refléter le comportement des modèles dans des flux de travail pratiques plutôt que dans des tests de référence statiques.

Comment Agent Arena évalue les modèles

Contrairement aux classements conventionnels qui s'appuient sur des questions de culture générale ou des tests standardisés, Agent Arena classe les modèles d'IA sur la base de l'orchestration d'outils en situation réelle et de l'efficacité d'accomplissement des tâches. La plateforme s'appuie sur des données provenant de plus de 1,7 million de sessions utilisateur et surveille des métriques telles que l'hallucination d'outils — où un modèle tente avec assurance d'utiliser un outil inexistant ou utilise mal un outil disponible — ainsi que les taux de réussite globaux.

Étant donné que le classement est basé sur des données d'utilisation en direct, les changements peuvent avoir une portée au-delà d'une simple mise à jour de score : ils peuvent indiquer comment un modèle se comporte lorsqu'il doit choisir des outils, se remettre d'erreurs et accomplir des tâches dans des environnements qui ressemblent davantage à des déploiements d'agents qu'à des requêtes de type examen.

Comparaison entre les générations de modèles Flash

La progression au sein de la gamme Flash de Google illustre le rythme d'itération des modèles. Le Gemini 3.5 Flash occupe actuellement la 27e place avec une amélioration nette de 0,39 %, tandis que le Gemini 3.6 Flash se classe plus loin, à environ la 34e position.

Le Gemini 3.6 Flash a été publié le 21 juillet 2026. Cette génération de modèles s'est concentrée sur une réduction de 17 % des tokens de sortie par rapport à ses prédécesseurs.

Des références trouvées dans le SDK Python GenAI de Google indiquent que la variante 3.7 est conçue pour améliorer davantage l'efficacité des tokens tout en intégrant des performances d'agent multimodal. Cela permettrait au modèle de fonctionner avec du texte, des images et potentiellement d'autres types de données au sein d'un même flux de travail agentique. À la mi-août 2026, le Gemini 3.7 Flash n'a pas encore été officiellement publié.

Position concurrentielle

Avec le Gemini 3.7 Flash à la 20e place, 19 modèles le surpassent actuellement sur des tâches d'agent en situation réelle. Aucune méthodologie officielle détaillant la façon dont le chiffre d'amélioration de 3,4 % a été calculé n'a été divulguée. Le score d'Agent Arena est dynamique — les modèles peuvent monter ou descendre au classement à mesure que de nouveaux concurrents font leur apparition et que des données de sessions utilisateur supplémentaires sont collectées.