NachrichtenAktienGPT-6 Sol und Luna starten mit 50 % niedrigeren API-Preisen, während unabhängige Tests gemischte Ergebnisse zeigen

GPT-6 Sol und Luna starten mit 50 % niedrigeren API-Preisen, während unabhängige Tests gemischte Ergebnisse zeigen

Autor: Metaverse Post·

Wichtige Erkenntnisse

  • GPT-6 Sol und GPT-6 Luna starten mit API-Preisen, die 50 % unter den promotionalen GPT-5.6-Raten liegen, bei 2 $ bzw. 0,10 $ pro Million Input-Tokens; OpenAI führt dies auf Gewinne bei Caching und Inferenz-Infrastruktur zurück.
  • OpenAIs Benchmarks zeigen, dass Sol auf AutomationBench Claude Opus 5 übertrifft (33,2 % gegenüber 26,9 %) bei etwa 9 % der Kosten pro Aufgabe und auf OSWorld 2.0 bei etwa einem Fünftel der Kosten das gleiche Niveau erreicht.
  • Unabhängige Tests durch Artificial Analysis bestätigten starke Kostensenkungen pro Aufgabe – Sol von 1,99 $ auf 1,06 $ und Luna von 0,18 $ auf 0,07 $ –, fanden jedoch etwa gleichbleibende Fähigkeits-Scores, mit Rückschritten bei Wissensarbeit von rund 100 Elo-Punkten für Sol und 75 für Luna auf GDPval-AA v2.1.
  • Sols Halluzinationsrate auf dem AA-Omniscience-Benchmark sank von 92 % auf 60 %, wobei ein Teil des Gewinns darauf zurückging, dass das Modell mehr Fragen unbeantwortet ließ, was seine Genauigkeit um 5 Punkte senkte.
  • Beide Modelle sind in ChatGPT Work und Codex für Plus-, Pro-, Business-, Enterprise- und Edu-Nutzer sowie über die API als gpt-6-sol und gpt-6-luna verfügbar; Luna ist über die Desktop-App zusätzlich für Free- und Go-Nutzer zugänglich.
GPT-6 Sol und Luna starten mit 50 % niedrigeren API-Preisen, während unabhängige Tests gemischte Ergebnisse zeigen

OpenAI hat GPT-6 Sol und GPT-6 Luna veröffentlicht und damit seine GPT-6-Modellfamilie erweitert, neben dem Flaggschiff GPT-6 Astra, das Anfang dieses Monats vorgestellt wurde. Das Unternehmen erklärt, die neuen Modelle erreichten in professioneller Arbeit, Faktentreue, Programmierung und Computerbedienung ein nahezu Astra-Niveau und senkten zugleich die API-Preise um 50 % gegenüber den promotionalen Preisen der vorherigen GPT-5.6-Generation.

OpenAI führte die niedrigeren Preise auf Verbesserungen bei Caching und Inferenz-Infrastruktur zurück und erklärte, die daraus resultierenden Einsparungen würden direkt an die Nutzer weitergegeben. GPT-6 Sol kostet jetzt 2 $ pro Million Input-Tokens und 10 $ pro Million Output-Tokens, gegenüber zuvor 4 $ bzw. 20 $. GPT-6 Luna kostet 0,10 $ pro Million Input-Tokens und 0,50 $ pro Million Output-Tokens, gegenüber früheren Preisen von 0,20 $ bzw. 1,20 $. Da die API-Abrechnung mit dem Token-Volumen skaliert, sind die Preise pro Token der wichtigste Kostenhebel für Entwickler, und eine Halbierung wirkt sich über die großen Token-Mengen, die Agenten-Workloads erzeugen können, kumulativ aus.

OpenAI beschreibt Astra als sein leistungsfähigstes Modell für die anspruchsvollsten Projekte, während Sol und Luna darauf ausgelegt sind, fortgeschrittene KI für Workloads mit höherem Volumen im Alltag praktikabler zu machen.

GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV — OpenAI Developers (@OpenAIDevs) September 22, 2026

GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV

Benchmark-Ergebnisse und technische Verbesserungen

Auf AutomationBench, das Agenten über 47 Geschäftstools in Vertrieb, Marketing, Betrieb, Support, Finanzen und Personalwesen hinweg evaluiert, erzielte GPT-6 Sol mit xhigh-Aufwand 33,2 % bei Kosten von 0,27 $ pro Aufgabe. Im Vergleich erreichte Claude Opus 5 mit maximalem Aufwand 26,9 %, während Sols Kosten pro Aufgabe etwa 9 % derer von Claude Opus 5 betrugen. Solche Kosten-pro-Aufgabe-Vergleiche sind zu einem Standardmerkmal von Releases leistungsstarker Modelle geworden und erscheinen neben den zentralen Benchmark-Scores.

Auf Agents’ Last Exam erreichte Sol mit maximalem Aufwand 56,4 % und übertraf damit Claude Opus 5s höchsten Wert bei etwa 60 % niedrigeren Kosten. In Coding-Evaluationen erreichte GPT-6 Sol 68,8 % auf DeepSWE v1.1, nur 1,1 Prozentpunkte unter Claude Fable 5s bestem Ergebnis bei etwa 80 % niedrigeren Kosten. Luna erreichte 66,6 %, vergleichbar mit Opus 5 und Fable 5 bei mittlerem Aufwand, bei 93–96 % niedrigeren Kosten. Auf OSWorld 2.0 erreichte Sol mit 60,5 % gegenüber 60,3 % das Niveau von Claude Opus 5 bei etwa einem Fünftel der Kosten.

OpenAI berichtete zudem, dass Sols faktische Fehlerrate im Vergleich zum Vorgängermodell halbiert wurde, gemessen in einer internen Evaluation von anonymisierten Konversationen, in denen Nutzer Fehler markiert hatten. Mit höherem Aufwand erreichte Luna die Zuverlässigkeit von GPT-5.6 Sol bei etwa einem Hundertstel der Kosten. Alignment-Evaluationen zeigten bei beiden Modellen Verbesserungen gegenüber ihren Vorgängern, darunter niedrigere Raten von Täuschung in bewusst anspruchsvollen Coding-Szenarien.

OpenAI hat außerdem das Prompt-Caching verbessert, um die Cache-Trefferquoten standardmäßig zu erhöhen. Das System bietet 90 % Rabatt auf Reads von gecachten Input-Tokens und umfasst ein Monitoring-Dashboard, Diagnosetools sowie Steuerungsmöglichkeiten, mit denen Entwickler Reasoning-Aufwand und Tool-Verfügbarkeit anpassen können, ohne den gecachten Kontext zu invalidieren. GitHub berichtete, dass diese Änderungen den Anteil der Prompt-Tokens, die eine erneute Verarbeitung erfordern, über Milliarden von Anfragen hinweg um mehr als 50 % reduziert haben.

GPT-6 Sol und Luna sind ab sofort in ChatGPT Work und Codex für Plus Pro-, Business-, Enterprise- und Edu-Nutzer verfügbar. Luna ist über die Desktop-App auch für Free- und Go-Nutzer zugänglich. Beide Modelle werden über die API als gpt-6-sol und gpt-6-luna angeboten, mit einer schrittweisen Einführung im Laufe des Tages.

Unabhängige Analyse findet Kostenvorteile und gemischte Leistung

Unabhängige Tests durch Artificial Analysis bestätigten OpenAIs Effizienzangaben weitgehend, zeichneten aber ein differenzierteres Bild der Fähigkeiten der Modelle. Mit seinem Intelligence Index stellte das Unternehmen fest, dass GPT-6 Sol mit maximalem Aufwand etwa 1,06 $ pro Aufgabe kostet, gegenüber 1,99 $ für den Vorgänger. Lunas Kosten sanken von 0,18 $ auf ,07 $ pro Aufgabe. Artificial Analysis erklärte, beide Modelle hätten die Kosteneffizienz-Pareto-Frontier erreicht.

Das Unternehmen sagte, die Einsparungen stammten vollständig aus der Preissenkung, da beide Modelle pro Aufgabe leicht mehr Output-Tokens verbrauchten als ihre Vorgänger.

GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN — Artificial Analysis (@ArtificialAnlys) September 22, 2026

GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN

Die Leistungsergebnisse zeigten sowohl Verbesserungen als auch Rückschritte. Sols Coding Agent Index Score stieg um 2 Punkte auf 57, mit Zuwächsen bei Terminal-Bench 4.0 und SWE-Atlas-QnA. Lunas Score fiel um 2 Punkte, mit Einbußen bei SWE-Atlas-QnA und DeepSWE v1.1. Das abweichende Bild gegenüber den Launch-Zahlen von OpenAI spiegelt teilweise Unterschiede in Benchmark-Suiten, Aufwandsstufen und Bewertungsmethodiken zwischen den beiden Ergebnissätzen wider.

Auf dem AA-Omniscience-Benchmark sank Sols Halluzinationsrate von 92 % auf 60 %. Artificial Analysis wies darauf hin, dass die Verbesserung teilweise darauf zurückzuführen war, dass das Modell mehr Fragen nicht beantwortete, was seine Genauigkeit um 5 Punkte reduzierte. Dieser Unterschied – Gewinne durch stärkere faktische Fundierung gegenüber Gewinnen durch Beantwortung weniger Fragen – ist ein wiederkehrender nuancierter Aspekt bei der Messung von Halluzinationen.

Die größten Rückschritte zeigten sich in Evaluationen zu Wissensarbeit. Sol fiel auf GDPval-AA v2.1 um etwa 100 Elo-Punkte, Luna um etwa 75 Punkte. Eine manuelle Prüfung führte die niedrigeren Scores auf kürzere Ergebnisse zurück, die erforderliche Rubrik-Elemente ausließen, sowie auf eine reduzierte Präsentationsqualität. Gelesen neben OpenAIs Zahlen rahmen die unabhängigen Ergebnisse diesen Launch primär als Kostengeschichte: Die Preise sanken insgesamt, während sich die Leistung je nach Benchmark und Aufgabenkategorie unterschiedlich entwickelte.