ActualitésActionsLes utilisateurs de GPT-6 Astra estiment que le nouveau modèle d'OpenAI a été « nerfé »

Les utilisateurs de GPT-6 Astra estiment que le nouveau modèle d'OpenAI a été « nerfé »

Auteur: Decrypt·

Points clés

  • Certains utilisateurs rapportent que GPT-6 Astra fournit désormais des réponses plus rapides mais de moindre qualité, et le développeur Pankaj Kumar soupçonne OpenAI d'avoir réduit l'effort de calcul du modèle, un changement que l'entreprise n'a pas confirmé.
  • Salio et le chercheur Md Ismail Sojal ont déclaré avoir exécuté des invites identiques le jour du lancement et sur la version actuelle avec les mêmes paramètres, et tous deux ont rapporté des résultats moins bons avec le modèle actuel.
  • L'équipe d'Opencode de Dax Raad est repassée à GPT-5.6 Sol après le doublement de ses dépenses, concluant que les inconvénients d'Astra ne justifiaient pas son tarif premium.
  • Des critiques, dont Antikythera et le fondateur de T3Chat Theo, estiment que le modèle n'a pas changé et que l'essoufflement du battage de la semaine de lancement révèle des incohérences anciennes.
  • Astra reste le premier modèle d'OpenAI à franchir le seuil critique de risque de cybersécurité défini par l'entreprise et est tarifé 10 $ par million de jetons d'entrée et 50 $ par million de jetons de sortie, soit 2,5 fois le prix de Sol à son lancement.
Les utilisateurs de GPT-6 Astra estiment que le nouveau modèle d'OpenAI a été « nerfé »

Les utilisateurs inondent X de plaintes affirmant que le GPT-6 Astra d'OpenAI est devenu moins performant à peine une semaine après son lancement. Certains utilisateurs rapportent des réponses plus rapides et des résultats plus médiocres, tandis que d'autres soutiennent que le modèle a toujours été incohérent et que l'enthousiasme initial a simplement masqué ses faiblesses.

Il y a une semaine, GPT-6 Astra reconstruisait Manhattan rue par rue dans un moteur de jeu, impressionnant les utilisateurs par ses capacités. Cette semaine, certains de ces mêmes utilisateurs publient des captures d'écran en demandant à OpenAI ce qu'il est arrivé au modèle.

« Astra feels significantly dumber for me today », a écrit le développeur pseudonyme synthwavedd sur X. « Was only a matter of time before The Post-Launch Lobotomy. Shame. »

Le schéma est familier aux utilisateurs de chatbots et d'agents d'intelligence artificielle, qui ont parfois l'impression que leur modèle favori a été « nerfé » après sa sortie — un terme emprunté au jeu vidéo décrivant le fait pour des développeurs d'affaiblir quelque chose de trop puissant. Il peut exister des explications raisonnables aux baisses de performance perçues, mais le nombre de plaintes similaires concernant GPT-6 Astra a poussé les utilisateurs à comparer les sorties et à examiner si le modèle a changé. La question a un enjeu pratique pour les développeurs qui construisent leurs produits sur des modèles qu'ils louent plutôt qu'ils n'exécutent, et comme les systèmes propriétaires n'exposent aucun interne à inspecter, les comparaisons de sorties côte à côte figurent parmi les rares outils de vérification dont disposent les observateurs extérieurs.

Le développeur Pranjal Paliwal, qui avait précédemment salué Astra, a déclaré avoir ensuite examiné le code écrit par le modèle et révisé son évaluation.

« We don't have AGI », a écrit Paliwal. « We have a regression. »

L'AGI, ou intelligence artificielle générale, est le terme utilisé par l'industrie pour désigner une machine capable d'accomplir essentiellement toute tâche cognitive qu'un hum peut réaliser. Le président d'OpenAI a employé ce terme lors du lancement d'Astra. Une semaine plus tard, Paliwal l'invoque pour décrire l'écart entre les capacités apparentes du modèle et ses erreurs.

Les autres plaintes suivent un schéma similaire. Le développeur Pankaj Kumar a cité parmi les symptômes des réponses plus rapides et une qualité moindre, ainsi que la suspicion qu'OpenAI ait « réduit le juice value ». La fondatrice Saba a également demandé à OpenAI pourquoi elle devait désormais « simplifier » ses demandes pour accomplir ses tâches.

Le « juice value » n'est pas un terme technique officiel. Dans ce contexte, les utilisateurs l'emploient comme raccourci pour désigner la quantité d'effort de calcul qu'un modèle mobilise avant de répondre, et la suspicion qu'OpenAI aurait réduit cet effort après les démonstrations de lancement. OpenAI n'a pas confirmé avoir apporté une telle modification à Astra.

Certains utilisateurs ont tenté des comparaisons directes. Salio et le chercheur Md Ismail Sojal ont dit avoir exécuté des invites identiques sur Astra le jour du lancement puis sur la version actuelle, avec les mêmes paramètres. Tous deux ont rapporté des résultats moins bons avec le modèle actuel.

« Today's GPT-6 Astra output looks worse. GPT-6 Astra at launch vs GPT-6 Astra today », a écrit Sojal. La publication indiquait que la comparaison utilisait la même invite et les mêmes paramètres, et que « [t]he difference is bigger than I expected ».

D'autres utilisateurs disent être repassés au prédécesseur d'Astra. Dax Raad, qui développe l'outil de codage Opencode, a déclaré que son équipe était revenue à GPT-5.6 Sol car ses dépenses avaient doublé tandis que les inconvénients d'Astra ne justifiaient pas le coût. L'utilisateur de ChatGPT Mustafa Sahinli a comparé Astra à Claude Opus 4.6 « after 1 week of release », en référence au contrecoup qu'avait également subi le modèle d'Anthropic après son lancement.

Tout le monde ne pense pas qu'OpenAI ait délibérément affaibli Astra. L'utilisateur pseudonyme Antikythera a publié la réfutation la plus détaillée, arguant que la chronologie pourrait être inversée.

« It is as dumb as it was on launch », a écrit Antikythera. « The model is good, but the model has a lot of problems. It's lazy. Writes like a bullet-point-addict... people were overhyped on launch week, now they had time to test it and see its mistakes. »

Selon cette explication, Astra n'est pas devenu moins performant ; les utilisateurs ont simplement cessé d'être éblouis par ses premières démonstrations et ont commencé à remarquer ses problèmes récurrents.

Theo, fondateur de T3Chat, a exprimé une opinion similaire. Selon lui, Astra est plus incohérent que Claude Fable et peut produire un code tantôt remarquable, tantôt extrêmement médiocre.

« GPT-6 Astra has done incredible things I never thought a model could do. It has also done some of the stupidest things I've ever seen a model do. Generally speaking, Fable 5.1 just does what I ask », a écrit Theo sur X le 8 septembre 202. L'augmentation des exemples négatifs, suggère-t-il, pourrait refléter la fin de la période de lune de miel initiale du modèle plutôt qu'un changement confirmé de son comportement.

Le débat rappelle les événements liés au précédent modèle phare d'OpenAI, GPT-5.6 Sol. En juillet, des utilisateurs avaient déclaré que le mode de raisonnement le plus élevé de Sol était devenu soudainement moins approfondi. Le dirigeant d'OpenAI Tibo Sottiaux avait nié avoir délibérément affaibli le modèle, tout en confirmant que l'entreprise expérimentait le « raisonnement effort », un paramètre contrôlant le nombre d'étapes qu'un modèle parcourt avant de produire une réponse.

Une réponse résumait la blague récurrente sur les laboratoires d'IA fermés : une entreprise publie un modèle, et quelques jours plus tard il attrape « some kind of disease a few days later and suddenly become[s] dumber ». Un autre utilisateur a proposé une explication plus cynique en une ligne : « They probably get quantized so they're not burning the companies as much money. »

La quantification réduit la précision des calculs internes d'un modèle afin de diminuer les coûts de calcul, souvent au prix d'une perte potentielle de précision. OpenAI n'a jamais confirmé avoir intentionnellement quantifié un modèle déjà commercialisé.

OpenAI n'a pas publié de déclaration de style Sol concernant Astra. En juillet, une vague similaire de plaintes sur Sol avait suscité une réponse officielle d'un dirigeant de l'entreprise ; la manière dont OpenAI traitera les plaintes sur Astra reste une question ouverte. Le modèle reste le premier de l'entreprise à franchir ce qu'OpenAI appelle le seuil critique de risque de cybersécurité. Cette désignation signifie qu'Astra peut découvrir et enchaîner des vulnérabilités logicielles jusque-là inconnues sans intervention humaine, une capacité réservée aux défenseurs agréés dans le cadre du programme Daybreak d'OpenAI.

Qu'Astra soit devenu moins performant ou non, son tarif affiché demeure de 10 $ par million de jetons d'entrée et 50 $ par million de jetons de sortie — soit 2,5 fois le prix de Sol à son lancement, une prime qu'au moins une équipe a déjà jugée injustifiée.