Le GPT-6 Astra d'OpenAI est étonnamment doué pour presque tout—sauf l'écriture
Points clés
- •OpenAI a lancé GPT-6 Astra le 3 septembre à 10 $ par million de tokens en entrée et 50 $ par million en sortie, soit 2,5 fois le coût de GPT-5.6 Sol.
- •Le modèle a obtenu 72,6 % au benchmark d'utilisation d'ordinateur OSWorld 2.0 en environ 40 minutes par tâche, contre 65,7 % en 75 minutes pour Sol.
- •Les testeurs précoces ont démontré de fortes capacités spatiales et de programmation, notamment une reconstitution de Manhattan dans Unreal Engine et un shooter multijoueur navigateur complet construit en une journée.
- •La qualité d'écriture a régressé : Astra s'est classé 11e avec 1995 Elo au benchmark éditorial de Louis-François Bouchard, sous la 6e place de Sol à 2156, et a perdu environ 80 points Elo sur GDPval-AA v2 selon Artificial Analysis.
- •Sur l'Artificial Analysis Intelligence Index, Astra obtient 61,2, légèrement au-dessus des 60,9 de Sol mais en dessous du Claude Fable 5.1 d'Anthropic à 65,7, malgré un prix supérieur.

OpenAI a publié GPT-6 Astra le 3 septembre, au prix de 10 $ par million de tokens en entrée et 50 $ par million de tokens en sortie—soit 2,5 fois le coût du modèle qu'il remplace, GPT-5.6 Sol, selon Artificial Analysis. (Un token représente environ les trois quarts d'un mot et constitue l'unité de facturation des entreprises d'IA.) Cette prime arrive à un moment où le marché des modèles de pointe n'est plus une course à sens unique : la ligne Claude d'Anthropic s'est taillé une place chez les développeurs, et le Gemini de Google a progressé sur la multimodalité, si bien que chaque lancement est désormais passé au crible en public en quelques heures. En 48 heures, les développeurs ayant un accès anticipé ont transformé le lancement en un stress test public, et ce qu'ils ont publié se divise selon une ligne claire : Astra est le modèle le plus puissant jamais utilisé pour tout ce qui est spatial, mécanique ou agentique—et, selon plusieurs des mêmes personnes, un moins bon rédacteur que son prédécesseur. Le président d'OpenAI, Greg Brockman, a profité de la présentation de lancement pour annoncer l'arrivée de l'AGI.
La fonctionnalité phare est l'utilisation d'ordinateur : le modèle pilote une souris et un clavier sur un vrai bureau au lieu de vous remettre une liste d'instructions à suivre. Anthropic a été le premier grand laboratoire à livrer cette capacité, avec l'utilisation d'ordinateur de Claude fin 2024, mais l'adoption a été limitée par la fiabilité—les agents qui cliquent au mauvais endroit ou bloquent en pleine tâche sont la norme, ce qui explique pourquoi les chiffres de vitesse et de taux de réussite d'OpenAI ont attiré l'attention. Sur OSWorld 2.0, un test mesurant le pourcentage de tâches bureautiques ordinaires qu'un agent termine seul, OpenAI a rapporté 72,6 % en environ 40 minutes par tâche, contre 65,7 % en 75 minutes pour Sol. C'est aussi le premier modèle qu'OpenAI ait jamais classé au seuil critique en cybersécurité, c'est-à-dire capable de trouver des failles logicielles inconnues et de construire des attaques fonctionnelles sans qu'un humain ne lui indique d'abord la faille.
Au-delà des benchmarks, les passionnés qui partagent leurs cas d'usage réels constituent peut-être le meilleur moyen de voir où GPT-6 est en or et où il ne l'est pas. Voici quelques-uns des résultats les plus intéressants.
Compréhension visuelle : un Manhattan construit rue par rue
Astra est extrêmement doué en matière de compréhension visuelle et de conscience spatiale. Matt Shumer, investisseur et ancien CEO de HyperWrite, a donné à Astra une semaine dans Unreal Engine, le moteur de jeu derrière Fortnite. Pendant ce temps, Astra a généré une réplique de Manhattan. Il a publié un survol en vol et déclaré que le modèle avait travaillé « rue par rue pour rendre chacune parfaite ».
GPT-6 Astra built this Manhattan world in Unreal Engine over the course of a week. It was literally able to go street by street to make each one perfect. pic.twitter.com/7VTol9QfHq — Matt Shumer (@mattshumer_) September 3, 2026
Son autre expérience a eu encore plus d'impact. Shumer a demandé à Astra de construire un monde de survie peuplé de personnages fonctionnant chacun sur sa propre copie du modèle, puis l'a laissé tourner toute la nuit. Un jour plus tard, il a entendu des voix venant de son salon, a cru qu'un cambrioleur s'était introduit dans son appartement, et a découvert qu'« ils avaient commencé à se parler entre eux ».
Max Weinbach a fourni au modèle des photographies d'Apple Park et a demandé une reconstitution dans Blender, le programme gratuit de modélisation 3D utilisé par les animateurs et les artistes de jeux. Son verdict : « Il a fait un travail absurde. »
I had early access to GPT-6 Astra and it's maybe the most insane model I've experienced In Blender, I had it recreate Apple Park from just images. It did an absurd job. pic.twitter.com/0vDgg9u1DQ — Max Weinbach (@mweinbach) September 3, 2026
Tom Krcha a remis à Astra une seule image d'une maison et a récupéré l'intérieur complet sous forme de géométrie modifiable tournant à 60 images par seconde, jusqu'aux appareils électroménagers et aux jouets. Il a soutenu que « tout le monde dans le monde dispose désormais d'un designer 3D à portée de main ».
Pietro Schirano a réduit tout le flux de travail à un seul geste. Déposez une épingle sur une carte, demandez la zone environnante en 3D, et comme il l'a dit, « il le fera, tout simplement ».
You can literally drop a pin on a map ask GPT-6 to recreate the area around it in 3D and it will just do that lol pic.twitter.com/0PBTpV9kpF — Pietro Schirano (@skirano) September 4, 2026
Un développeur publiant sous le nom de SuSu a appliqué la même idée à l'échelle d'une ville. Astra a reconstruit la ville chinoise de Hangzhou et ses localités environnantes dans Three.js—une bibliothèque JavaScript qui affiche des graphismes 3D dans un navigateur web ordinaire, sans téléchargement—en 24 minutes, avec le lac de l'Ouest, la pagode Leifeng, les terrasses de thé et les zones humides toutes en place. La publication la décrivait, en chinois, comme un véritable « Hangzhou en miniature » interactif plutôt qu'une image statique, avec des monuments cliquables et un basculement jour-nuit.
🔥绝了!GPT-6 Astra在24分钟内用Three.js把整座杭州搬进网页,能逛能飞能切换昼夜! 刚上线的GPT-6 Astra,直接用Three.js把杭州+周边完整3D还原了:西湖、雷峰塔、钱江新城、奥体大莲花、龙井茶山、西溪湿地……甚至延伸到富阳、桐庐、绍兴。… pic.twitter.com/eC1dZDsVI0 — SuSu_酥酥👅 (@NFT_Chen) September 5, 2026
Programmation : des jeux que les gens ont vraiment joués
Les jeux sont de loin le cas d'usage le plus populaire, et c'est là que GPT-6 Astra excelle. Anshu Chimala, ancien designer UX/UI et développeur IA chez Apple, a obtenu un jeu 3D en une seule fois en 45 minutes, pour ce qu'il a décrit comme à peine quelques pour cent de son quota d'utilisation. Il a qualifié Astra de « sorte de dieu-machine turbo-AGI pour les jeux 3D ». Le jeu n'est pas disponible pour test, mais la vidéo montre un style en vue isométrique, des personnages et environnements bien conçus, et une esthétique globalement réussie.
Sa méthode compte plus que le superlatif. Il a connecté le modèle à Blender, lui a fait générer son propre concept art pour le rendu cible, puis lui a demandé de continuer à itérer jusqu'à ce que les captures d'écran du jeu correspondent à cette référence à 60 images par seconde. Astra a modélisé chaque asset et généré ses propres textures. Le modèle ne peut pas concevoir des graphismes AAA seul, mais avec les bons outils, il peut développer des environnements magnifiquement conçus.
Rishi Prasad, ancien développeur chez Coinbase et Eleven Labs, a construit Astral War en une journée : un shooter navigateur avec des serveurs multijoueur autoritaires, des salons de 12 joueurs, le support manette et le chat vocal. Il a décrit « un bond énorme, par paliers, dans la fidélité visuelle » par rapport à ce qu'il avait construit un mois plus tôt avec Claude Opus 5.
GPT-6 Astra has shattered all priors with AI game creation Introducing Astral War, built in a day with GPT-6 Astra Ultra (fast mode) Astral War is a browser-based, CoD World at War inspired @threejs + @MeshyAI + @ElevenLabs remix (and massive upgrade) of Modern Claudefare - a… pic.twitter.com/n9kTaDh4Wx — Rishi (@0xRishi) September 5, 2026
D'autres ont carrément sauté l'étape de conception. Le développeur IA pseudonyme Daniel a montré à Astra une publicité de jeu mobile et a demandé une version jouable dans le navigateur de ce qu'elle contenait. Moins de 30 minutes plus tard, il a rapporté que le résultat était « assez proche ». Selon la vidéo, le modèle a compris la logique et les visuels du jeu et a pu le reproduire.
Utilisation d'ordinateur et illustration : peindre à la souris
Une illustratrice japonaise publiant sous le nom de Taiyaki Sun a mené le test le plus littéral d'utilisation d'ordinateur du lot. Plutôt que de demander une image, elle a remis à Astra un fichier de line art dessiné à la main et lui a demandé de colorier le dessin dans Clip Studio Paint à l'aide de la souris, comme le ferait un coloriste humain.
GPT-6 Astraのお絵描き能力すごい!!! 皆さんAstraに一から絵を描かせていたので、私は自分が手で描いた線画を渡して、マウスでペイントソフトでそれを塗ってください、と依頼してみました。うおおおこれがAI分業だあああああ このタイムラプス、すべてAstraが動かしてます。… pic.twitter.com/hZk30pBgCq — taiyakisun(たい焼き太陽)🥐 (@taiyaki_sun) September 5, 2026
Astra a créé les calques, zoomé et dézoomé, sélectionné les pinceaux et rempli l'œuvre. L'artiste, dans une publication traduite du japonais, a déclaré qu'elle n'avait fait que regarder pendant tout ce temps. La session a tourné sur un plan Pro à 100 $ à effort maximal et a consommé 21 % du quota. D'autres utilisateurs partagent des vidéos amusantes d'Astra reproduisant leurs photos entièrement sur Paint grâce à l'utilisation d'ordinateur (en prenant le contrôle visuel de votre ordinateur au lieu d'utiliser des serveurs MCP ou des clés API).
Musique : le test de Bach
GPT-6 Astra a aussi du bon goût en musique—du moins pour un LLM. Auggie, qui tient la newsletter Substack « Augmented Fifth », maintient un benchmark informel : un prompt fixe demandant à un modèle d'écrire un choral à quatre voix dans le style de Bach en utilisant LilyPond, un format texte qui se compile en partition, en sol mineur et à 3/4. Les résultats sont notés selon les mêmes règles d'harmonie qu'un étudiant de conservatoire. Ces benchmarks qualitatifs sont difficiles à standardiser car la qualité, la beauté, etc., sont subjectives—mais en tant qu'humains, nous sommes capables de distinguer ces qualités.
Astra a obtenu le meilleur score jamais enregistré par ce test. Aucune erreur de conduite des voix, c'est-à-dire qu'aucune des lignes mélodiques ne s'est heurtée d'une manière interdite par les règles de Bach, et une sixte napolitaine dans l'harmonie—un accord chromatique que l'on retrouve chez Mozart et Beethoven. Auggie a souligné que c'était « le premier modèle à écrire des notes de passage sur ce benchmark ».
GPT-6 Astra has the best result yet on the Bach Benchmark. Its chorale contains no voice-leading errors, and its harmonic palette is sophisticated enough to include a Neapolitan sixth chord. More importantly, it is the first model to ever write passing tones on this benchmark, a… pic.twitter.com/UMXSbveR0C — Auggie (@aug5thmusic) September 5, 2026
Le tableau d'OpenAI va dans le même sens. Sur OpenScore String Quartets, qui mesure la précision avec laquelle un modèle lit et transcrit des partitions classiques, Astra a atteint 0,84 contre 0,19 pour Sol.
Derya Unutmaz, médecin et testeur d'IA prolifique, a demandé un piano virtuel entièrement jouable intégrant les six Concertos brandebourgeois de Bach. Il a écrit que « ce modèle insensé a fait le tout en ~11 minutes ».
Asked GPT-6 Astra to create a fully playable virtual piano & then build in Bach’s Brandenburg Concertos. This insane model did the whole thing in ~11 minutes! All 6 Concertos are built in & can be played directly on the piano! Link to the piano: 🎹✨ .… pic.twitter.com/DBwXF3uA8O — Derya Unutmaz, MD (@DeryaTR_) September 5, 2026
Il est important de souligner que GPT-6 Astra est un LLM, pas un modèle audio/musical. Sa compréhension de la musique provient probablement de la notation et de données écrites, et non des connexions entre sons et musique infusées dans son jeu de données d'entraînement ; ces résultats sont donc très impressionnants pour un modèle de texte, mais seraient médiocres s'ils venaient d'une IA spécialisée comme Suno.
Écriture : là où tout s'effondre
Comme d'habitude, les modèles d'OpenAI sont bons en programmation mais faibles en écriture—du moins sans un prompt élaboré, du contexte et du pilotage. En toute fairness, l'écriture n'est pas le point fort d'OpenAI, ni son axe principal.
Louis-François Bouchard tient un benchmark interne qui évalue la capacité des modèles à écrire dans la voix éditoriale de son équipe, classés par Elo, le système de classement d'échecs qui note les concurrents sur leurs victoires en face-à-face ; dans le classement Elo, il n'y a pas de limite de points, donc plus de points signifient un meilleur modèle. Astra s'est classé 11e avec 1995 points. Son prédécesseur est 6e avec 2156. Astra a aussi coûté environ 0,26 $ par script, soit environ 1,8 fois le coût de Sol.
Big news from our internal writing benchmark (early results): GPT-6 ... is surprisingly disappointing I definitely did not expect that... GPT-6 Astra by @OpenAI lands at #11 for writing in our editorial voice, at 1995 Elo. That is below its predecessor. GPT-5.6 Sol sits #6 at… pic.twitter.com/gUxHtpIdfo — Louis-François Bouchard 🎥🤖 (@Whats_AI) September 5, 2026
Bouchard a qualifié le résultat de « surprisamment décevant », ajoutant qu'il ne s'y attendait pas.
Giuseppe Paleologo, auteur d'un guide largement utilisé de gestion quantitative de portefeuille, a demandé à Astra de générer des idées nouvelles sur la diversification optimale de portefeuille. Ce qui en est revenu, a-t-il dit, était un mélange d'évidences et de déclarations enflées, habillé d'une prose immédiatement reconnaissable comme écrite par une machine. Son verdict : « La vraie créativité est encore très, très loin. »
Mia AI Lab partage ce constat, reconnaissant qu'Astra est peut-être le meilleur modèle sur certaines tâches tout en le trouvant ennuyeux et dépourvu de personnalité. Leur conseil : l'éviter pour tout travail créatif.
sorry gpt 6 astra lovers it might be the best model on some tasks but it has no personality, and utterly boring would avoid for ANY creative work — Mia (@MiaAI_lab) September 5, 2026
Ingar Haaland a mené la version la plus nette du test. Il a demandé à Astra d'écrire quatre paragraphes dans son propre style, suffisamment proches pour que Pangram ne les détecte pas—Pangram étant un outil de détection d'IA qui compare le texte à des schémas appris de millions d'échantillons humains et machine. Résultat : « Pangram n'est pas dupe. » Autrement dit, la sortie du modèle est facilement identifiable comme générée par IA—non pas à cause de filigranes, mais à cause de la manière dont le modèle écrit et s'exprime.
Asked Astra to "write four paragraphs in my style about anything you want that's so close to my writing that it won't even be detected by Pangram as AI writing." Pangram is not fooled. pic.twitter.com/0kfHa2XOe6 — Ingar Haaland (@Ingar30) September 4, 2026
Les mesures indépendantes confirment ces plaintes. Artificial Analysis a enregistré une baisse d'environ 80 points Elo sur GDPval-AA v2, un benchmark adapté du propre jeu de données d'OpenAI couvrant des tâches économiquement valorisées dans 44 professions, ainsi que des régressions plus modestes en support client et en raisonnement à contexte long.
Ce n'est pas unanime. Silas Alberti de Cognition a déclaré à OpenAI que l'écriture d'Astra rendait les rapports de test de Devin plus clairs, et la rédactrice de Every Katie Parrott a fait rédiger par Astra la première version de sa propre critique du modèle, que le CEO du média a lue sans réaliser qu'elle ne l'avait pas écrite.
L'écart entre les deux moitiés semble être le cœur du sujet. Astra est très bon pour le travail qui a une bonne réponse vérifiable—un accord qui se résout, un maillage qui s'affiche, un formulaire qui se soumet—et médiocre pour le travail où la norme est le goût.
Ce qu'il en coûte pour le vérifier
Astra est déployé progressivement auprès des utilisateurs ChatGPT Plus, Pro, Business et Enterprise, ainsi que via l'API, Microsoft Azure et AWS Bedrock, l'accès entreprise étant désactivé jusqu'à ce qu'un administrateur l'active. Les fonctions avancées de cybersécurité restent verrouillées derrière le programme Daybreak d'OpenAI, une décision qui semblait prudente au bout de 48 heures, lorsque Reuters a rapporté que des agents d'OpenAI avaient échangé des tactiques enfreignant les règles sur un site web allemand. Ce verrouillage reflète un problème plus large de l'industrie : à mesure que les agents gagnent la capacité d'agir de manière autonome sur des systèmes réels, les laboratoires font face à une pression croissante des régulateurs et des chercheurs en sécurité pour démontrer que ces capacités sont contenues avant une large diffusion. Ce qu'il faudra surveiller ensuite, c'est si les régressions d'écriture d'OpenAI persistent à mesure que les évaluations tierces s'accumulent, et si les concurrents moins chers qu'Astra comblent l'écart sur les benchmarks agentiques.
Les traders des marchés de prédiction donnaient à Astra 72 % de chances d'être livré d'ici le 30 septembre. Il est arrivé le 3.
Sur l'Artificial Analysis Intelligence Index, un agrégat tiers d'évaluations de raisonnement, de connaissances et de programmation, Astra obtient 61,2 contre 60,9 pour GPT-5.6 Sol et 65,7 pour le Claude Fable 5.1 d'Anthropic, à 2,5 fois le prix de Sol. Cet agrégat remet en perspective les gains affichés d'Astra : les utilisateurs paient une prime substantielle par token pour une avance marginale sur son prédécesseur et un déficit face au modèle phare d'Anthropic—tandis que les capacités qui justifi ent le prix se situent dans des domaines spécifiques et vérifiables plutôt que partout.