NieuwsAandelenGPT-6 Sol en Luna lanceren met 50% lagere API-prijzen, terwijl onafhankelijke tests gemengde prestaties laten zien

GPT-6 Sol en Luna lanceren met 50% lagere API-prijzen, terwijl onafhankelijke tests gemengde prestaties laten zien

Auteur: Metaverse Post·

Belangrijkste punten

  • GPT-6 Sol en GPT-6 Luna lanceren met API-prijzen 50% onder de promotionele tarieven van GPT-5.6 liggen, vastgesteld op respectievelijk $2 en $0,10 per miljoen inputtokens, wat OpenAI toeschrijft aan winsten in caching en inferentie-infrastructuur.
  • OpenAI’s benchmarks laten zien dat Sol Claude Opus 5 overtreft op AutomationBench (33,2% tegenover 26,9%) tegen ongeveer 9% van de kosten per taak, en het evenaart op OSWorld 2.0 tegen ongeveer een vijfde van de kosten.
  • Onafhankelijke tests door Artificial Analysis bevestigden steile dalingen in kosten per taak — Sol van $1,99 naar $1,06 en Luna van $0,18 naar $0,07 — maar vonden capaciteitsscores die vrijwel gelijk bleven, met achteruitgang in kenniswerk van ongeveer 100 Elo-punten voor Sol en 75 voor Luna op GDPval-AA v2.1.
  • Sols hallucinatiepercentage op de AA-Omniscience-benchmark daalde van 92% naar 60%, hoewel een deel van de winst kwam doordat het model meer vragen weigerde te beantwoorden, wat de nauwkeurigheid met 5 punten verlaagde.
  • Beide modellen zijn beschikbaar in ChatGPT Work en Codex voor Plus-, Pro-, Business-, Enterprise- en Edu-gebruikers en via de API als gpt-6-sol en gpt-6-luna, met Luna bovendien toegankelijk voor Free- en Go-gebruikers via de desktopapp.
GPT-6 Sol en Luna lanceren met 50% lagere API-prijzen, terwijl onafhankelijke tests gemengde prestaties laten zien

OpenAI heeft GPT-6 Sol en GPT-6 Luna uitgebracht, waarmee het zijn GPT-6-modelfamilie uitbreidt naast het vlaggenschip GPT-6 Astra, dat eerder deze maand werd geïntroduceerd. Het bedrijf zegt dat de nieuwe modellen prestaties leveren die het niveau van Astra benaderen in professioneel werk, feitelijkheid, codering en computergebruik, terwijl de API-prijzen met 50% worden verlaagd in vergelijking met de promotionele prijzen van de vorige GPT-5.6-generatie.

OpenAI schreef de lagere prijzen toe aan verbeteringen in caching en inferentie-infrastructuur en zei dat de besparingen rechtstreeks aan gebruikers worden doorgegeven. GPT-6 Sol kost nu $2 per miljoen inputtokens en $10 per miljoen outputtokens, een daling van $4 en $20 respectievelijk. GPT-6 Luna kost $0,10 per miljoen inputtokens en $0,50 per miljoen outputtokens, tegen eerdere prijzen van $0,20 en $1,20. Omdat API-facturering schaalt met tokenvolume, zijn de tarieven per token de belangrijkste kostenhefboom voor ontwikkelaars, en een halvering ervan heeft een vermenigvuldigend effect op de grotevolumes die agentworkloads kunnen genereren.

OpenAI omschrijft Astra als zijn krachtigste model voor de meest veeleisende projecten, terwijl Sol en Luna bedoeld zijn om geavanceerde AI praktischer te maken voor grotere, dagelijkse workloads.

GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV — OpenAI Developers (@OpenAIDevs) September 22, 2026

GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV

Benchmarkresultaten en technische verbeteringen

Op AutomationBench, dat agents test op 47 zakelijke tools in verkoop, marketing, operations, support, financiën en HR, scoorde GPT-6 Sol op xhigh effort 33,2% tegen kosten van $0,27 per taak. Ter vergelijking: Claude Opus 5 scoorde 26,9% op maximale effort, terwijl Sols kosten per taak ongeveer 9% waren van die van Claude Opus 5. Vergelijkingen van kosten per taak zoals deze zijn een standaardonderdeel geworden van de lanceringen van grensmodellen, naast de opvallende benchmarkscores.

Op Agents’ Last Exam behaalde Sol op maximale effort een score van 56,4%, wat de hoogste score van Claude Opus 5 overtrof tegen ongeveer 60% lagere kosten. In codeerevaluaties scoorde GPT-6 Sol 68,8% op DeepSWE v1.1, binnen 1,1 procentpunt van het beste resultaat van Claude Fable 5, tegen ongeveer 80% lagere kosten. Luna scoorde 66,6%, vergelijkbaar met Opus 5 en Fable 5 op medium effort, tegen 93–96% lagere kosten. Op OSWorld 2.0 evenaarde Sol Claude Opus 5, met 60,5% tegenover 60,3%, tegen ongeveer een vijfde van de kosten.

OpenAI meldde ook dat Sols feitelijke foutenpercentage gehalveerd was ten opzichte van zijn voorganger in een interne evaluatie van geanonimiseerde gesprekken waarin gebruikers fouten hadden gemarkeerd. Bij hogere effort evenaarde Luna de betrouwbaarheid van GPT-5.6 Sol tegen ongeveer een honderdste van de kosten. Alignment-evaluaties lieten zien dat beide modellen beter presteerden dan hun voorgangers, waaronder lagere percentages van bedrog in bewust uitdagende codeerscenario’s.

OpenAI heeft ook promptcaching verbeterd om de standaard cache hit rates te verhogen. Het systeem biedt 90% korting op het lezen van gecachte inputtokens en omvat een monitoringdashboard, diagnostische tools en bedieningsmogelijkheden waarmee ontwikkelaars reasoning effort en toolbeschikbaarheid kunnen aanpassen zonder de gecachte context ongeldig te maken. GitHub meldde dat deze wijzigingen het aandeel prompttokens dat opnieuw verwerkt moest worden met meer dan 50% verminderden, over miljarden verzoeken heen.

GPT-6 en Luna zijn beschikbaar in ChatGPT Work en Codex voor Plus Pro-, Business-, Enterprise- en Edu-gebruikers. Luna is ook beschikbaar voor Free- en Go-gebruikers via de desktopapp. Beide modellen worden via de API aangeboden als gpt-6-sol en gpt-6-luna, met een geleidelijke uitrol gedurende de dag.

Onafhankelijke analyse vindt kostenbesparingen en gemengde prestaties

Onafhankelijke tests door Artificial Analysis ondersteunden OpenAI’s efficiëntieclaims grotendeels, maar gaven een meer gemengde beoordeling van de capaciteiten van de modellen. Met zijn Intelligence Index stelde het bedrijf vast dat GPT-6 Sol op maximale effort ongeveer $1,06 per taak kostte, tegenover $1,99 voor zijn voorganger. Luna’s kosten daalden van $0,18 naar $0,07 per taak. Artificial Analysis zei dat beide modellen de Pareto-frontier van kostenefficiëntie hadden bereikt.

Het bedrijf zei dat de besparingen volledig van de prijsverlaging kwamen, omdat beide modellen per taak iets meer outputtokens gebruikten dan hun voorgangers.

GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN — Artificial Analysis (@ArtificialAnlys) September 22, 2026

GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN

De prestatieresultaten lieten zowel verbeteringen als achteruitgang zien. Sols Coding Agent Index-score steeg met 2 punten naar 57, met vooruitgang op Terminal-Bench 4.0 en SWE-Atlas-QnA. Luna’s score daalde met 2 punten, met achteruitgang op SWE-Atlas-QnA en DeepSWE v1.1. Het afwijkende beeld ten opzichte van OpenAI’s lanceringcijfers weerspiegelt deels verschillen in benchmarksuites, effortniveaus en beoordelingsmethodologieën tussen de twee sets resultaten.

Op de AA-Omniscience-benchmark daalde Sols hallucinatiepercentage van 92% naar 60%. Artificial Analysis merkte op dat de verbetering deels te danken was aan het feit dat het model meer vragen weigerde te beantwoorden, wat de nauwkeurigheid met 5 punten verlaagde. Dat onderscheid — winst door sterkere feitelijke onderbouwing versus winst door minder vragen te beantwoorden — is een terugkerend nuance bij het meten van hallucinaties.

De grootste achteruitgang verscheen in evaluaties van kenniswerk. Sol daalde met ongeveer 100 Elo-punten op GDPval-AA v2.1, terwijl Luna ongeveer 75 punten zakte. Handmatige inspectie schreef de lagere scores toe aan kortere deliverables die vereiste rubricelementen weglieten en aan verminderde presentatiekwaliteit. Gelezen naast OpenAI’s cijfers kaderen de onafhankelijke resultaten deze lancering vooral als een kostenverhaal: de prijzen daalden over de hele linie, terwijl de capaciteitsontwikkeling per benchmark en taakcategorie varieerde.