ActualitésActionsSpaceXAI d'Elon Musk lance Grok 4.7 avec un score de 71 % au benchmark DeepSWE

SpaceXAI d'Elon Musk lance Grok 4.7 avec un score de 71 % au benchmark DeepSWE

Auteur: Coinotag·

Points clés

  • SpaceXAI a publié Grok 4.7 le 21 septembre, le présentant comme son modèle le plus capable à ce jour pour le codage et le travail intellectuel, avec un entraînement axé sur des tâches nécessitant plusieurs heures.
  • Le modèle est lancé à 2 $ par million de tokens en entrée et 6 $ par million de tokens en sortie, à l'identique de Grok 4.6 et bien en dessous de GPT-5.6 Sol à 4 $/20 $ et Fable 5.1 à 10 $/50 $.
  • Selon les benchmarks publiés par SpaceXAI, Grok 4.7 a obtenu 71,0 % sur DeepSWE v1.1, porté Terminal-Bench 4.0 de 20,3 % à 38,0 %, dominé l'EEBench et le benchmark d'agents juridiques Harvey, tout en étant devancé par Fable 5.1 sur CursorBench 4.0 et HealthBench Professional.
  • Une pile de sécurité reconstruite a bloqué tous les prompts à double usage à haut risque sauf 3,3 % dans HackerBench v0.3, avec peu de refus erronés, et certains partenaires en cybersécurité ont reçu un accès red team sur invitation uniquement.
  • Quelques heures avant le lancement, les trois configurations de Grok 4.6 ont perdu contre toutes les configurations Codex et Claude dans le Brood War Bench de Ben Swerdlow, avec un meilleur résultat de 2 victoires sur 18 matchs, et Grok 4.7 n'a pas été classé.
SpaceXAI d'Elon Musk lance Grok 4.7 avec un score de 71 % au benchmark DeepSWE

Grok 4.7 conçu pour les charges de travail de plusieurs heures

SpaceXAI, l'unité d'intelligence artificielle d'Elon Musk, a dévoilé Grok 4.7 le 21 septembre, le présentant comme le modèle le plus capable de l'entreprise à ce jour pour le codage et le travail intellectuel. Selon l'annonce officielle, le nouveau système repose sur un modèle de base plus vaste que Grok 4.6 et a suivi des cycles d'apprentissage par renforcement plus longs sur des mélanges de tâches plus difficiles, avec une attention délibérée portée aux problèmes nécessitant plusieurs heures.

L'entreprise a structuré sa communication autour de l'endurance. Là où les modèles précédents répondaient en quelques minutes, Grok 4.7 est optimisé pour venir à bout de tâches qui occuperaient un ingénieur ou un analyste humain pendant des heures. SpaceXAI a indiqué que le modèle est désormais nettement meilleur pour vérifier ses propres productions sur de longues sessions, pour gérer de très longues fenêtres de contexte (la quantité de texte qu'un modèle peut garder simultanément en mémoire de travail) et pour utiliser nativement le framework d'agents Grok Bot, ce type de configuration en plusieurs étapes où un modèle planifie, appelle des outils et exécute le travail de manière autonome plutôt que de répondre à une simple requête — des améliorations qui, selon l'entreprise, se manifestent dans la conversation, les tâches de culture générale et la production de documents et présentations professionnels.

Sur les benchmarks publiés, la configuration xhigh se situe au niveau de la frontière. Sur DeepSWE v1.1, une suite d'évaluation en génie logiciel, Grok 4.7 a affiché 71,0 %, dépassant de justesse Fable 5.1 max à 70,0 % et ne étant devancé que par GPT-5.6 Sol max à 72,7 %. Sur Terminal-Bench 4.0, qui évalue les travaux en terminal de plusieurs heures, le modèle est passé de 20,3 % pour son prédécesseur à 38,0 %. Sur les suites simulant des missions professionnelles de plusieurs heures pour avocats, infirmières et analystes financiers — AA Briefcase et HealthBench notamment — SpaceXAI a déclaré que Grok 4.7 égale désormais les meilleurs du secteur.

La sécurité est l'autre affirmation majeure. Une pile de sécurité reconstruite en fait la version la plus robuste de l'entreprise pour refuser les demandes inappropriées et résister aux jailbreaks, ces tentatives de contourner les garde-fous d'un modèle. Dans HackerBench v0.3, qui teste les tâches cyber malveillantes, seuls 3,3 % des prompts à double usage à haut risque — des requêtes aux applications à la fois légitimes et nuisibles — sont passés, avec peu de refus erronés de travaux de sécurité défensive légitimes. Certains partenaires en cybersécurité ont reçu un accès red team sur invitation uniquement, un test adversarial au cours duquel des chercheurs en sécurité sondent un système pour y déceler des faiblesses, afin de soutenir la recherche en défense.

Le modèle est disponible dès maintenant via Cursor, Grok Build, l'API Grok, les grandes plateformes cloud et les routeurs de modèles, ces services qui transmettent la requête d'un développeur au modèle d'IA de son choix via une interface unique.

Tarif de 2 $ maintenu tandis que le Brood War Bench humiliating Grok 4.6

La tarification est la constante discrète : Grok 4.7 est lancé à 2 $ par million de tokens en entrée et 6 $ par million de tokens en sortie — à l'identique de Grok 4.6 — plus une variante rapide qui double la vitesse de sortie au double du prix. Les tokens sont les unités de texte que les modèles de langage lisent et génèrent, et la facturation API est calculée sur leur base : l'entrée couvre ce qu'envoie le développeur, la sortie ce que le modèle rédige. Ces tarifs sous-cotent fortement la concurrence : GPT-5.6 Sol est annoncé à 4 $/20 $ par million de tokens et Fable 5.1 à 10 $/50 $, plaçant la tarification de Grok à environ un tiers à la moitié des niveaux concurrents, avec une livraison plus rapide.

Le tableau comparatif de SpaceXAI montre que Grok 4.7 domine en génie électrique (EEBench : 64,0 % contre 39,4 % pour GPT-5.6 Sol et 56,4 % pour Fable 5.1) et sur le benchmark d'agents juridiques Harvey (19,6 % contre 2,5 % et 6,7 %), tout en étant devancé par Fable 5.1 en génie logiciel (CursorBench 4.0 : 46,3 % contre 51,8 %) et en raisonnement clinique (HealthBench Professional : 56,7 % contre 62,1 %). Chaque chiffre provient des données publiées par SpaceXAI.

Le contexte corporatif compte : SpaceXAI a pris sa forme actuelle en février, lorsque xAI a fusionné avec SpaceX, suivie de l'acquisition de Cursor en juin, l'éditeur de code IA qui sert également de canal de lancement de Grok 4.7 — une partie de l'empire de Musk qui englobe Tesla (TSLA) et, selon nos informations antérieures, une initiative visant à consolider les abonnements IA d'ici quelques semaines.

Quelques heures avant le lancement, pourtant, un benchmark participatif a égratigné le prédécesseur. Le Brood War Bench du développeur Ben Swerdlow dans lequel des agents IA jouent à StarCraft: Brood War, a circulé sur X le 20 septembre : 19 configurations issues de Codex, Claude et Grok se sont affrontées dans 171 matchs en tête-à-tête, et Codex Astra a balayé ses 18 parties en raisonnement maximal. Les trois configurations de Grok 4.6 ont perdu contre toutes les configurations Codex et Claude, avec un meilleur résultat de 2 victoires sur 18. La stratégie en temps réel constitue un test exigeant pour les agents car les décisions économiques, de production et de combat arrivent en continu — il n'existe aucun tour pour marquer une pause et planifier.

Swerdlow a consigné un match dans lequel une configuration Grok en raisonnement maximal a consommé 11 138 tokens de raisonnement en 43 minutes tout en n'émettant que six lots de commandes — sans jamais déployer une seule unité de combat. Il a écrit que Grok n'est pas encore assez intelligent pour ce jeu, les modèles plus anciens traitant la stratégie en temps réel comme un jeu au tour par tour, et a ajouté qu'aucun participant n'a dépassé le niveau débutant. Grok 4.7 n'a pas été classé.

Lecture de COINOTAG : la pression sur les prix est le vrai signal

Pris ensemble, les chiffres du jour de lancement et les résultats du Brood War racontent une même histoire : les laboratoires de pointe vendent désormais le raisonnement à des prix de commodité, et la fiabilité agentique — et non les scores de benchmarks statiques — décide des vainqueurs. Selon l'analyse de COINOTAG, la grille 2 $/6 $ confère à Grok 4.7 une tokenomics que les concurrents devront égaler, de la même manière que la tarification à terme force les marchés à réancrer leurs attentes, tandis que les laboratoires dépourvus de capacités de calcul comparables risquent de devenir de la liquidité de sortie dans cette guerre des prix. Le média a ajouté que les annonces de Musk sur le calcul ont historiquement influencé le sentiment sur les actifs liés à Musk comme Dogecoin (DOGE), et a recommandé de surveiller les résultats agentiques de Grok 4.7 plutôt que ses promesses de lancement.