ActualitésMacroxAI lance Grok 4.7 avec de nouveaux garde-fous et de meilleures performances sur les tâches de plusieurs heures

xAI lance Grok 4.7 avec de nouveaux garde-fous et de meilleures performances sur les tâches de plusieurs heures

Auteur: Metaverse Post·

Points clés

  • •Grok 4.7 est bâti sur un nouveau modèle de base plus grand et entraîné via un cycle d'apprentissage par renforcement prolongé sur des tâches plus difficiles, ce que xAI présente comme améliorant la génération de code, la gestion des longs contextes et l'auto-vérification.
  • •Les plus grands gains de benchmark du modèle concernent le codage et le travail en terminal de longue durée, avec Terminal-Bench 4.0 passant de 20,3 % à 38,0 % et CursorBench 4.0 de 40,4 % à 46,3 %.
  • •Grok 4.7 embarque une pile de sécurité entièrement nouvelle, décrite par xAI comme la plus forte testée en matière de refus et de résistance au jailbreak, et il domine le benchmark de biosécurité de LatchBio avec 62,4 %.
  • •La tarification reste aux niveaux de Grok 4.6 : 2 $ par million de tokens d'entrée et 6 $ par million de tokens de sortie, en dessous des tarifs de GPT-5.6 Sol et Fable 5.1.
  • •Artificial Analysis a attribué à Grok 4.7 un score de 46 sur son Intelligence Index, un gain de deux points plaçant SpaceXAI parmi les quatre principaux laboratoires d'IA, mais a constaté que le modèle utilisait environ 81 000 tokens de sortie par tâche, plus du double des 36 000 de Grok 4.6, augmentant les coûts effectifs.
xAI lance Grok 4.7 avec de nouveaux garde-fous et de meilleures performances sur les tâches de plusieurs heures

xAI a publié Grok 4.7, le décrivant comme son modèle le plus capable à ce jour pour le codage et le travail sur la connaissance. L'entreprise positionne ce modèle comme une offre de pointe à un prix compétitif, avec une tarification inchangée par rapport à son prédécesseur, Grok 4.6.

Grok 4.7 est bâti sur un nouveau modèle de base plus grand et a été entraîné via un cycle d'apprentissage par renforcement prolongé utilisant un mélange de tâches plus difficile, axé sur des problèmes nécessitant de nombreuses heures de travail. Selon xAI, ces changements d'entraînement améliorent la génération de code, la gestion des longs contextes et l'auto-vérification. Le modèle comprend également nativement le harnais Grok Bot, ce qui, selon l'entreprise, le rend plus efficace pour les tâches conversationnelles et le travail général sur la connaissance.

Les plus grands gains rapportés se sont concentrés sur les tâches de codage et de terminal de longue durée. Sur CursorBench 4.0, Grok 4.7 a obtenu un score de 46,3 %, contre 40,4 % pour Grok 4.6. Son score dépasse celui de GPT-5.6 Sol (41,7 %) mais reste inférieur à celui de Fable 5.1 (51,8 %). À effort élevé sur DeepSWE v1.1, Grok 4.7 a obtenu 71,0 %, derrière GPT-5.6 Sol à 72,7 % mais dépassant de justesse Fable 5.1 à 70,0 %.

Le modèle s'est également amélioré par rapport à Grok 4.6 sur GDPval et AA Briefcase, ce dernier évaluant des tâches de bureau de plusieurs heures effectuées par des professionnels tels que des avocats, des infirmiers et des analystes financiers. Sur AA Briefcase, Grok 4.7 a obtenu 1 657, proche du 1 678 de Fable 5.1. Sa progression la plus marquante est venue de Terminal-Bench 4.0, qui mesure le travail en terminal de plusieurs heures : le score de Grok 4.7 est passé de 20,3 % pour Grok 4.6 à 38,0 %.

Sur HackerBench v0.3, qui couvre les tâches cyber à risque, le modèle n'a laissé passer que 3,3 % des requêtes dangereuses à double usage tout en bloquant rarement le travail de sécurité légitime.

Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO — SpaceXAI (@SpaceXAI) September 21, 2026

Nouvelle pile de sécurité et tarification inchangée

Un élément central de cette version est la pile de sécurité de Grok 4.7, que xAI décrit comme entièrement nouvelle et la plus forte qu'elle ait testée en matière de comportement de refus et de résistance au jailbreak. Le modèle domine le benchmark de biosécurité de LatchBio avec un score de 62,4 %, alliant performance sur les tâches bénignes et refus des demandes dangereuses dans les domaines à double usage tels que la cybersécurité et la recherche biologique. xAI a également commencé à accorder à certains partenaires en cybersécurité un accès sur invitation aux capacités de red team du modèle à des fins de recherche en défense.

Grok 4.7 est proposé aux mêmes tarifs que Grok 4.6 : 2 $ par million de tokens d'entrée et 6 $ par million de tokens de sortie. Ces tarifs sont inférieurs aux prix de GPT-5.6 Sol (4 $ et 20 $ respectivement) et à ceux de Fable 5.1 (10 $ et 50 $). Une variante rapide offrant une vitesse de sortie double est disponible au double du prix. Les tarifs fixes par token rendent la comparaison directe simple, bien que le coût total d'un travail de longue durée dépende également du nombre de tokens qu'un modèle consomme pour terminer une tâche.

Sur la frontière prix-performance de CursorBench, cette tarification place Grok 4.7 parmi les options les plus rentables pour les charges de travail de codage étendues. Le modèle est disponible immédiatement dans Cursor et Grok Build, ainsi que via l'API Grok, des harnais de codage tiers, des routeurs de modèles et des plateformes cloud.

Cette version intensifie la concurrence entre les fournisseurs de modèles de pointe, qui comparent de plus en plus les systèmes sur les tâches agentiques de longue durée, le calibrage de la sécurité et le coût par tâche accomplie, en plus des simples scores de benchmark. Pour les développeurs et les entreprises évaluant des modèles orientés codage, Grok 4.7 combine une tarification stable avec de meilleurs scores sur les tâches de plusieurs heures et de nouveaux garde-fous.

Artificial Analysis confirme les gains mais signale la consommation de tokens

Le cabinet d'évaluation indépendant Artificial Analysis a également évalué Grok 4.7, lui attribuant un score de 46 sur son Intelligence Index. C'est deux points de plus que Grok 4.6, plaçant SpaceXAI parmi les quatre principaux laboratoires d'IA, selon le cabinet. Cette évaluation externe rejoint le positionnement de xAI, qui présente cette version comme un pas en avant pour le codage et le travail sur la connaissance.

L'évaluation, menée à un effort de raisonnement xhigh, a identifié la progression la plus nette dans le travail agentique sur la connaissance à long terme. Sur le benchmark privé AA-Briefcase d'Artificial Analysis, Grok 4.7 a gagné 111 points Elo par rapport à son prédécesseur pour atteindre 1 657, le plaçant aux côtés de Claude Opus 5 et Claude Fable 5.1 à la frontière. Cette progression a été principalement portée par la qualité analytique, passant de 1 690 à 1 994 Elo. La qualité de présentation est restée globalement stable.

Sur GDPval-AA, qui mesure les produits de travail pratiques tels que documents, feuilles de calcul et présentations, Grok 4.7 a obtenu 1 695 Elo, soit une hausse de 90 points.

Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI labs. Coding Agent Index performance has also improved, overtaking GPT-5.6 Sol Grok 4.7 scores +2 points over Grok 4.6 on the Intelligence Index, with strong performance on… pic.twitter.com/8p4KC6cgZy — Artificial Analysis (@ArtificialAnlys) September 21, 2026

https://x.com/ArtificialAnlys/status/2102074898327932987?ref_src=twsrc%5Etfw

Artificial Analysis a constaté que les améliorations de performance nécessitaient beaucoup plus de calcul. À l'effort xhigh, Grok 4.7 a utilisé environ 81 000 tokens de sortie par tâche de l'Intelligence Index, plus du double des 36 000 tokens utilisés par Grok 4.6 et près de trois fois les 27 000 tokens consommés par GPT-6 Astra à effort maximal. Les tarifs par token restant inchangés, cette consommation accrue augmente le coût effectif d'une tâche comparable même si les prix affichés sont restés stables.

Le cabinet a rapporté des améliorations supplémentaires modestes sur Terminal-Bench 4.0 et GDP.pdf, ainsi que de légères régressions sur AA-LCR et AutomationBench-AA. La fiabilité s'est légèrement améliorée : le taux d'hallucination AA-Omniscience est tombé de 34 % à 29 %, tandis que la précision est restée quasi inchangée à 47 %.

Les autres spécifications techniques demeurent identiques à celles de la génération précédente, notamment une fenêtre de contexte de 500 000 tokens. La tarification en cas de hit de cache est réduite à 0,50 $ par million de tokens. Avec le modèle disponible sur Cursor, Grok Build, l'API Grok, les harnais tiers, les routeurs de modèles et les plateformes cloud, les développeurs peuvent désormais peser les gains de benchmark face à la consommation plus élevée de tokens sur leurs propres charges de travail. Le rapport original est disponible sur Metaverse Post.