ActualitésActionsxAI lance Grok 4.7 après des reports répétés, mais reste derrière ses concurrents de pointe aux benchmarks

xAI lance Grok 4.7 après des reports répétés, mais reste derrière ses concurrents de pointe aux benchmarks

Auteur: Decrypt·

Points clés

  • Grok 4.7 utilise 2 100 milliards de paramètres, soit une hausse de 40 % par rapport aux 1 500 milliards de Grok 4.6, et est facturé 2 dollars par million de tokens d'entrée et 6 dollars par million de tokens de sortie.
  • xAI a enrichi l'entraînement du modèle avec des données de SpaceX, notamment la télémétrie Starlink, les dossiers de fabrication et les journaux d'incidents d'ingénierie, afin d'améliorer le raisonnement sur le matériel et les systèmes physiques.
  • Les premiers benchmarks classent Grok 4.7 deuxième derrière Claude Fable 5.1 sur GDPval (1695 contre 1735) et AA-Briefcase (1657 contre 1678), et deuxième derrière GPT-6 Astra sur le test d'ingénierie électrique EEBench.
  • Le lancement a suivi au moins cinq reports depuis fin juillet, et le modèle a été mis en ligne immédiatement sans liste d'attente dans l'application Grok, Cursor, Grok Build et l'API xAI.
  • Musk a indiqué que Grok 4.7 devrait se situer globalement au niveau du Claude Opus 5.0 d'Anthropic, et a esquissé les prochains modèles—Grok 4.8, Grok 4.9 et un possible Grok 5 leader de pointe—sans leur attribuer de dates de sortie.
xAI lance Grok 4.7 après des reports répétés, mais reste derrière ses concurrents de pointe aux benchmarks

L'xAI d'Elon Musk a publié lundi après-midi Grok 4.7, son modèle le plus capable à ce jour, que l'entreprise a présenté comme « une amélioration notable par rapport à Grok 4.6 au même prix et à la même vitesse ».

Les premiers résultats de benchmarks placent le modèle deuxième derrière Claude Fable 5.1 sur GDPval et AA-Briefcase, et deuxième derrière GPT-6 Astra sur EEBench, un benchmark d'ingénierie électrique.

Le lancement est arrivé après une série d'échéances manquées. Musk a repoussé le calendrier de sortie au moins cinq fois depuis fin juillet : d'abord « dans quatre semaines », puis « quelques semaines », puis « 3 à 4 semaines », puis « 10 jours » le 1er septembre, et enfin « a encore besoin de quelques jours de cuisson » le 11 septembre.

Cette fois, pas de liste d'attente. Grok 4.7 est disponible immédiatement dans l'application Grok, Cursor, Grok Build et l'API xAI.

Musk a ensuite précisé sur X, qualifiant Grok 4.7 de « combinaison puissante d'intelligence, de rapidité et de faible coût ».

Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO

SpaceXAI (@SpaceXAI) September 21, 2026

Selon l'annonce officielle d'xAI, le modèle passe plus de temps à résoudre les problèmes difficiles et vérifie plus souvent ses propres réponses que ne le faisait Grok 4.6, tout en bénéficiant de ce que l'entreprise décrit comme ses garde-fous de sécurité les plus robustes à ce jour.

Échelle, tarification et données SpaceX

Grok 4.7 embarque 2 100 milliards de paramètres, en hausse de 40 % par rapport aux 1 500 milliards de Grok 4.6, qui était lui-même un raffinement de Grok 4.5. Le coût est fixé à 2 dollars par million de tokens d'entrée et 6 dollars par million de tokens de sortie. Les paramètres sont les réglages internes qu'un modèle ajuste pendant l'entraînement, et leur nombre plus élevé signifie généralement une plus grande capacité à apprendre des motifs, tandis que les tokens sont les unités de base d'information qu'un modèle d'IA peut enregistrer ou générer.

xAI a également intégré des données d'entraînement supplémentaires issues de SpaceX, la société fusées de Musk : la télétrie des satellites Starlink, les dossiers de fabrication et les journaux d'incidents d'ingénierie. L'argument de vente : un modèle qui raisonne mieux sur le matériel et les systèmes physiques que tout ce qui a été entraîné uniquement sur du texte issu d'Internet.

Les benchmarks racontent une histoire familière

GDPval mesure comment un modèle se comporte sur un travail cognitif réel et économiquement précieux—notes juridiques, feuilles de calcul, présentations—en utilisant des tâches validées par des professionnels en exercice de chaque domaine, et le note selon un classement Elo, le même système de classement en face-à-face qu'emploient les échecs. Grok 4.7 a obtenu 1695 sur GDPval, tandis que Claude Fable 5.1 domine le classement à 1735—soit un écart de 40 points sur l'échelle Elo.

AA-Briefcase, développé par Artificial Analysis, teste un travail de bureau de plusieurs heures enchaînant recherche, analyse et production de documents en une seule longue tâche, également noté sur l'échelle Elo. Grok 4.7 a affiché 1657 contre 1678 pour Fable 5.1—un écart plus étroit de 21 points, et le même résultat sur un test différent.

CursorBench 4.0, le benchmark de Cursor pour les tâches de codage réelles au sein de son éditeur, croise la précision avec le coût et le nombre de tokens que consomme chaque tâche. Grok 4.7 se situe au milieu : plus cher par tâche que GPT-6 Astra, le successeur de GPT-5.6 Sol, et Claude Sonnet 5, mais toujours derrière Fable 5.1, qui gagne à tous les niveaux de prix du graphique.

Un schéma récurrent pour xAI

L'entreprise a lancé à plusieurs reprises des modèles phares qui sont arrivés derrière leurs rivaux lors d'évaluations indépendantes. Grok 4.5 a fait ses débuts en juillet avec le plus grand cluster d'entraînement du secteur et des scores de troisième place derrière les modèles de Claude et d'OpenAI. Avant lui, Grok 4.20 avait troqué la fiabilité contre la vitesse et la personnalité, et Grok 4.6 avait également été distancé par le peloton de pointe en matière d'autonomie de codage.

Rien de tout cela ne fait de Grok 4.7 un mauvais produit pour les millions de personnes qui lui parlent via X, l'application autonome ou le tableau de bord de leur Tesla. Cela signifie simplement que le modèle le plus susceptible de répondre aux questions des utilisateurs—ou d'alimenter l'assistant vocal de leur voiture—repose sur un système que les propres benchmarks de son créateur placent un cran en dessous du sommet de la hiérarchie.

Cet écart explique pourquoi le tarif compte plus que la position au classement pour la plupart des gens. xAI pratique systématiquement des prix par token inférieurs à ceux d'Anthropic et d'OpenAI tout en étant en retrait sur les capacités brutes, pariant que « suffisant, bon marché et omniprésent » l'emporte sur « le meilleur, mais plus cher » pour la majorité des usages quotidiens.

Les attentes de Musk et la route à venir

Musk avait déjà tempéré les attentes quelques jours avant le lancement, écrivant sur X que Grok 4.7 devrait se situer « globalement au niveau » du Claude Opus 5.0 d'Anthropic—et non du plus récent Opus 5.1—les performances multimodales nécessitant encore du travail.

Dans la même publication, il a esquissé les prochains modèles : Grok 4.8 comme une avancée significative, Grok 4.9 de « classe Astra/Fable », et Grok 5 comme potentiel leader de pointe. Ces mises à niveau n'ont pas encore de date de sortie—un détail qui prend un poids supplémentaire sachant que le propre calendrier de Grok 4.7 a été repoussé au moins cinq fois avant le lancement. « Nous verrons bien », a-t-il écrit.