GPT-6 Sol i Luna debiutują z obniżką cen API o 50%, a niezależne testy pokazują mieszane wyniki
Najważniejsze informacje
- •GPT-6 Sol i GPT-6 Luna debiutują z cenami API o 50% niższymi od stawek promocyjnych GPT-5.6, wynoszącymi odpowiednio 2 i 0,10 dolara za milion tokenów wejściowych, co OpenAI przypisujeyskom w buforowaniu i infrastrukturze inferencji.
- •Benchmarki OpenAI pokazują, że Sol przewyższa Claude Opus 5 w AutomationBench (33,2% wobec 26,9%) przy około 9% jego kosztu na zadanie i dorównuje mu w OSWorld 2.0 przy około jednej piątej kosztu.
- •Niezależne testy Artificial Analysis potwierdziły silny spadek kosztów na zadanie — Sol z 1,99 do 1,06 dolara, a Luna z 0,18 do 0,07 dolara — ale wykazały, że wyniki możliwości pozostają wyrównane, z regresjami w pracy wiedzy wynoszącymi około 100 punktów Elo dla Sola i 75 dla Luni w GDPval-AA v2.1.
- •Wskaźnik halucynacji Sola w benchmarku AA-Omniscience spadł z 92% do 60%, choć część poprawy wynikała z częstszych odmów odpowiedzi, co obniżyło jego dokładność o 5 punktów.
- •Oba modele są dostępne w ChatGPT Work i Codex dla użytkowników Plus, Pro, Business, Enterprise i Edu oraz w API jako gpt-6-sol i gpt-6-luna, przy czym Luna jest dodatkowo dostępna dla użytkowników Free i Go przez aplikację desktopową.

OpenAI oficjalnie udostępniło dwa nowe modele, GPT-6 Sol i GPT-6 Luna, rozszerzając rodzinę GPT-6 obok flagowego GPT-6 Astra, zaprezentowanego na początku tego miesiąca. Według firmy nowe modele zapewniają wydajność zbliżoną do poziomu Astry w pracy zawodowej, rzetelności faktograficznej, kodowaniu i obsłudze komputera, obniżając jednocześnie ceny API o 50% w porównaniu z cenami promocyjnymi poprzedniej generacji GPT-5.6.
OpenAI przypisało niższe ceny ulepszeniom w zakresie buforowania i infrastruktury inferencji, stwierdzając, że powstałe oszczędności są bezpośrednio przekazywane użytkownikom. GPT-6 Sol kosztuje teraz 2 dolary za milion tokenów wejściowych i 10 dolarów za milion tokenów wyjściowych, wobec 4 i 20 dolarów wcześniej. GPT-6 Luna kosztuje 0,10 dolara za milion tokenów wejściowych i 0,50 dolara za milion tokenów wyjściowych, w porównaniu z poprzednimi cenami 0,20 i 1,20 dolara. Ponieważ rozliczenia API skalują się z wolumenem tokenów, stawki za token są główną dźwignią kosztową dla deweloperów, a ich zmniejszenie o połowę kumuluje się przy dużych wolumenach tokenów, jakie mogą generować obciążenia agentowe.
OpenAI opisuje Astrę jako swój model o najwyższych możliwościach dla najbardziej wymagających projektów, podczas gdy Sol i Luna mają uczynić zaawansowaną AI bardziej praktyczną dla codziennych obciążeń o większym wolumenie.
GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV — OpenAI Developers (@OpenAIDevs) September 22, 2026
GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with. To production and beyond. pic.twitter.com/ZCEFp4JdjV
Wyniki benchmarków i ulepszenia techniczne
W teście AutomationBench, który ocenia agentów na 47 narzędziach biznesowych w obszarach sprzedaży, marketingu, operacji, wsparcia, finansów i zasobów ludzkich, GPT-6 Sol przy poziomie wysiłku xhigh uzyskał wynik 33,2% przy koszcie 0,27 dolara za zadanie. Dla porównania, Claude Opus 5 przy maksymalnym wysiłku osiągnął 26,9%, a koszt Sola na zadanie stanowił około 9% kosztu Claude Opus 5. Tego rodzaju porównania kosztów na zadanie stały się standardowym elementem premier modeli granicznych, obok nagłówkowych wyników benchmarków.
W teście Agents’ Last Exam Sol przy maksymalnym wysiłku uzyskał wynik 56,4%, przewyższając najwyższy wynik Claude Opus 5 przy kosztach niższych o około 60%. W testach kodowania GPT-6 Sol zdobył 68,8% w DeepSWE v1.1, w granicach 1,1 punktu procentowego od najlepszego wyniku Claude Fable 5, przy kosztach niższych o około 80%. Luna uzyskała 66,6%, co jest porównywalne z Opus 5 i Fable 5 przy średnim wysiłku, przy kosztach niższych o 93–96%. W OSWorld 2.0 Sol dorównał Claude Opus 5, osiągając 60,5% wobec 60,3%, przy około jednej piątej kosztu.
OpenAI podało również, że wskaźnik błędów faktograficznych Sola został zmniejszony o połowę względem poprzednika w wewnętrznej ewaluacji zanonimizowanych rozmów, w których użytkownicy zgłaszali błędy. Przy wyższym poziomie wysiłku Luna dorównała niezawodności GPT-5.6 Sol przy około jednej setnej kosztu. Ewaluacje alignementu wykazały poprawę obu modeli względem poprzedników, w tym niższy wskaźnik decepcji w celowo trudnych scenariuszach kodowania.
OpenAI ulepszyło także buforowanie promptów, aby domyślnie zwiększyć wskaźnik trafień w cache. System oferuje 90% zniżki na odczyty zbuforowanych tokenów wejściowych oraz obejmuje pulpit monitorowania, narzędzia diagnostyczne i kontrole pozwalające deweloperom dostosowywać poziom wysiłku rozumowania i dostępność narzędzi bez unieważniania zbuforowanego kontekstu. GitHub poinformował, że te zmiany zmniejszyły o ponad 50% udział tokenów promptu wymagających świeżego przetwarzania w miliardach zapytań.
GPT-6 Sol i Luna są dostępne od dziś w ChatGPT Work i Codex dla użytkowników Plus, Pro, Business, Enterprise i Edu, a Luna jest również dostępna dla użytkowników Free i Go przez aplikację desktopową. Oba modele są oferowane w API jako gpt-6-sol i gpt-6-luna, z stopniowym wdrażaniem w ciągu dnia.
Analiza niezależna potierdza oszczędności i mieszane wyniki
Niezależne testy przeprowadzone przez Artificial Analysis w dużej mierze potwierdziły twierdzenia OpenAI o efektywności, ale dały bardziej zniuansowany obraz możliwości modeli. Korzystając ze swojego Intelligence Index, firma ustaliła, że GPT-6 Sol przy maksymalnym wysiłku kosztuje około 1,06 dolara za zadanie, w porównaniu z 1,99 dolara u poprzednika. Koszt Luni spadł z 0,18 do 0,07 dolara za zadanie. Artificial Analysis stwierdziło, że oba modele osiągnęły front efektywności kosztowej Pareto.
Firma zaznaczyła, że oszczędności wynikają wyłącznie z obniżki cen, ponieważ oba modele zużywają nieco więcej tokenów wyjściowych na zadanie niż ich poprzednicy.
GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN — Artificial Analysis (@ArtificialAnlys) September 22, 2026
GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN
Wyniki wydajności wykazały zarówno postępy, jak i regresje. Wynik Sola w Coding Agent Index wzrósł o 2 punkty do 57, z zyskami w Terminal-Bench 4.0 i SWE-Atlas-QnA. Wynik Luni spadł o 2 punkty, z pogorszeniem w SWE-Atlas-QnA i DeepSWE v1.1. Rozbieżność względem danych OpenAI z dnia premiery wynika częściowo z różnic w zestawach benchmarków, poziomach wysiłku i metodologiach punktacji między tymi dwoma zbiorami wyników.
W benchmarku AA-Omniscience wskaźnik halucynacji Sola spadł z 92% do 60%. Artificial Analysis zauważyło, że poprawa wynikała częściowo z tego, że model częściej odmawiał odpowiedzi na pytania, co obniżyło jego dokładność o 5 punktów. To rozróżnienie — zyski z silniejszego oparcia faktograficznego versus zyski z odpowiadania na mniej pytań — to powtarzający się niuans w pomiarze halucynacji.
Największe regresje pojawiły się w ewaluacjach pracy wiedzy. Sol spadł o około 100 punktów Elo w GDPval-AA v2.1, a Luna o około 75 punktów. Inspekcja ręczna przypisała niższe wyniki krótszym rezultatom pomijającym wymagane elementy rubryki oraz obniżeniu jakości prezentacji. W zestawieniu z danymi OpenAI niezależne wyniki przedstawiają tę premierę przede wszystkim jako historię o kosztach: ceny spadły we wszystkich obszarach, podczas gdy zmiany możliwości różniły się w zależności od benchmarku i kategorii zadań.