ActualitésActionsGPT-6 Sol et Luna lancés avec des prix API réduits de 50 % alors que des tests indépendants montrent des performances mitigées

GPT-6 Sol et Luna lancés avec des prix API réduits de 50 % alors que des tests indépendants montrent des performances mitigées

Auteur: Metaverse Post·

Points clés

  • GPT-6 Sol et GPT-6 Luna sont lancés avec des prix API inférieurs de 50 % aux tarifs promotionnels de GPT-5.6, fixés respectivement à 2 $ et 0,10 $ par million de tokens d'entrée, une baisse qu'OpenAI attribue aux gains en caching et en infrastructure d'inférence.
  • Les benchmarks d'OpenAI montrent que Sol surpasse Claude Opus 5 sur AutomationBench (33,2 % contre 26,9 %) pour environ 9 % de son coût par tâche, et l'égale sur OSWorld 2.0 pour environ un cinquième du coût.
  • Les tests indépendants d'Artificial Analysis ont confirmé de fortes baisses de coûts par tâche — Sol de 1,99 $ à 1,06 $ et Luna de 0,18 $ à 0,07 $ — mais relevé des scores de capacités globalement stables, avec des régressions en travail intellectuel d'environ 100 points Elo pour Sol et 75 pour Luna sur GDPval-AA v2.1.
  • Le taux d'hallucinations de Sol sur le benchmark AA-Omniscience est passé de 92 % à 60 %, mais une partie du gain provient du refus du modèle de répondre à davantage de questions, ce qui a réduit sa précision de 5 points.
  • Les deux modèles sont disponibles dans ChatGPT Work et Codex pour les utilisateurs Plus, Pro, Business, Enterprise et Edu, ainsi que via l'API sous les identifiants gpt-6-sol et gpt-6-luna, Luna étant également accessible aux utilisateurs Free et Go via l'application de bureau.
GPT-6 Sol et Luna lancés avec des prix API réduits de 50 % alors que des tests indépendants montrent des performances mitigées

OpenAI a officiellement lancé GPT-6 Sol et GPT-6 Luna, élargissant sa famille de modèles GPT-6 aux côtés du modèle phare GPT-6 Astra, introduit plus tôt ce mois-ci. L'entreprise indique que les nouveaux modèles offrent des performances s'approchant du niveau d'Astra en matière de travail professionnel, de factualité, de programmation et d'utilisation informatique, tout en réduisant les prix de l'API de 50 % par rapport aux tarifs promotionnels de la génération GPT-5.6 précédente.

OpenAI a attribué la baisse des prix à des améliorations du caching et de l'infrastructure d'inférence, affirmant que les économies ainsi réalisées sont directement répercutées sur les utilisateurs. GPT-6 Sol coûte désormais 2 $ par million de tokens d'entrée et 10 $ par million de tokens de sortie, contre respectivement 4 $ et 20 $ auparavant. GPT-6 Luna coûte 0,10 $ par million de tokens d'entrée et 0,50 $ par million de tokens de sortie, contre des prix précédents de 0,20 $ et 1,20 $. La facturation de l'API étant proportionnelle au volume de tokens, les tarifs par token constituent le principal levier de coûts pour les développeurs, et leur division par deux s'amplifie sur les volumes importants de tokens que peuvent générer les charges de travail agentiques.

OpenAI décrit Astra comme son modèle le plus performant pour les projets les plus exigeants, tandis que Sol et Luna sont conçus pour rendre l'IA avancée plus pratique pour les charges de travail quotidiennes à volume plus élevé.

GPT-6 Sol and Luna just landed in Astra's orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV — OpenAI Developers (@OpenAIDevs) September 22, 2026

GPT-6 Sol and Luna just landed in Astra's orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV

Résultats des benchmarks et améliorations techniques

Sur AutomationBench, qui évalue les agents sur 47 outils métier couvrant les ventes, le marketing, les opérations, le support, la finance et les ressources humaines, GPT- Sol en effort xhigh a obtenu un score de 33,2 % à un coût de 0,27 $ par tâche. Cela à comparer aux 26,9 % de Claude Opus 5 en effort maximal, le coût par tâche de Sol représentant environ 9 % de celui de Claude Opus 5. Ce type de comparaison du coût par tâche est devenu un élément standard des lancements de modèles de pointe, aux côtés des scores de benchmarks phares.

Sur Agents' Last Exam, Sol en effort maximal a atteint un score de 56,4 %, dépassant le meilleur score de Claude Opus 5 à un coût environ 60 % inférieur. Dans les évaluations de programmation, GPT-6 Sol a obtenu 68,8 % sur DeepSWE v1.1, à 1,1 point de pourcentage du meilleur résultat de Claude Fable 5, à un coût environ 80 % inférieur. Luna a obtenu 66,6 %, un score comparable à celui d'Opus 5 et de Fable 5 en effort moyen, à un coût inférieur de 93 à 96 %. Sur OSWorld 2.0, Sol a égalé Claude Opus 5, avec 60,5 % contre 60,3 %, pour environ un cinquième du coût.

OpenAI a également indiqué que le taux d'erreurs factuelles de Sol avait été divisé par deux par rapport à son prédécesseur dans le cadre d'une évaluation interne de conversations dé-identifiées dans lesquelles des utilisateurs avaient signalé des erreurs. En effort élevé, Luna a atteint la fiabilité de GPT-5.6 Sol pour environ un centième du coût. Les évaluations d'alignement ont montré que les deux modèles progressaient par rapport à leurs prédécesseurs, notamment avec des taux de tromperie plus faibles dans des scénarios de programmation délibérément difficiles.

OpenAI a également amélioré le prompt caching pour augmenter les taux de hits du cache par défaut. Le système offre une remise de 90 % sur les lectures de tokens d'entrée en cache et comprend un tableau de bord de supervision, des outils de diagnostic et des contrôles permettant aux développeurs d'ajuster l'effort de raisonnement et la disponibilité des outils sans invalider le contexte en cache. GitHub a rapporté que ces changements ont réduit de plus de 50 % la part de tokens de prompt nécessitant un traitement neuf sur des milliards de requêtes.

GPT-6 Sol et Luna sont disponibles dès aujourd'hui dans ChatGPT Work et Codex pour les utilisateurs Plus, Pro, Business, Enterprise et Edu. Luna est également accessible aux utilisateurs Free et Go via l'application de bureau. Les deux modèles sont proposés via l'API sous les identifiants gpt-6-sol et gpt-6-luna, avec un déploiement progressif au cours de la journée.

Une analyse indépendante confirme les gains de coûts et relève des performances mitigées

Les tests indépendants menés par Artificial Analysis ont globalement confirmé les affirmations d'OpenAI en matière d'efficacité, tout en offrant une évaluation plus nuancée des capacités des modèles. À l'aide de son Intelligence Index, la société a constaté que GPT-6 Sol en effort maximal coûtait environ 1,06 $ par tâche, contre 1,99 $ pour son prédécesseur. Le coût de Luna est passé de 0,18 $ à 0,07 $ par tâche. Artificial Analysis a indiqué que les deux modèles avaient atteint la frontière de Pareto en matière de rapport coût-efficacité.

La société a précisé que les économies provenaient entièrement de la baisse des prix, les deux modèles consommant légèrement plus de tokens de sortie par tâche que leurs prédécesseurs.

GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN — Artificial Analysis (@ArtificialAnlys) September 22, 2026

GPT-6 Sol and Luna push the cost efficiency frontier by hal cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN

Les résultats de performances ont montré à la fois des progrès et des régressions. Le score Coding Agent Index de Sol a augmenté de 2 points pour atteindre 57, avec des gains sur Terminal-Bench 4.0 et SWE-Atlas-QnA. Le score de Luna a chuté de 2 points, avec des reculs sur SWE-Atlas-QnA et DeepSWE v1.1. Ce tableau divergent par rapport aux chiffres annoncés par OpenAI le jour du lancement reflète en partie les différences de suites de benchmarks, de niveaux d'effort et de méthodologies de notation entre les deux séries de résultats.

Sur le benchmark AA-Omniscience, le taux d'hallucinations de Sol est passé de 92 % à 60 %. Artificial Analysis a noté que cette amélioration s'expliquait en partie par le refus du modèle de répondre à davantage de questions, ce qui a réduit sa précision de 5 points. Cette distinction — des gains issus d'un ancrage factuel plus solide versus des gains issus d'un moindre nombre de réponses — est une nuance récurrente dans la mesure des hallucinations.

Les régressions les plus significatives sont apparues dans les évaluations de travail intellectuel. Sol a perdu environ 100 points Elo sur GDPval-AA v2.1, et Luna environ 75. Une inspection manuelle a attribué ces scores plus faibles à des livrables plus courts omettant des éléments requis par le barème et à une qualité de présentation réduite. Lus aux côtés des chiffres d'OpenAI, ces résultats indépendants présentent ce lancement avant tout comme une histoire de coûts : les prix ont baissé sur toute la ligne, tandis que l'évolution des capacités variait selon les benchmarks et les catégories de tâches.