GPT-6 Sol e Luna debuttano con tagli del 50% sui prezzi API, ma i test indipendenti mostrano risultati contrastanti
Punti chiave
- •GPT-6 Sol e GPT-6 Luna debuttano con prezzi API inferiori del 50% rispetto alle tariffe promozionali di GPT-5.6, fissati rispettivamente a 2 e 0,10 dollari per milione di token di input, un risultato che OpenAI attribuisce ai guadagni nel caching e nell'struttura di inferenza.
- •I benchmark di OpenAI mostrano Sol che supera Claude Opus 5 su AutomationBench (33,2% contro 26,9%) a circa il 9% del costo per task, eguagliandolo su OSWorld 2.0 a circa un quinto del costo.
- •I test indipendenti di Artificial Analysis hanno confermato forti cali del costo per task — Sol da 1,99 a 1,06 dollari e Luna da 0,18 a 0,07 dollari — ma hanno rilevato punteggi di capacità sostanzialmente stabili, con regressioni nel lavoro cognitivo di circa 100 punti Elo per Sol e 75 per Luna su GDPval-AA v2.1.
- •Il tasso di allucinazioni di Sol sul benchmark AA-Omniscience è sceso dal 92% al 60%, sebbene parte del guadagno derivi dal modello che ha rifiutato di rispondere a più domande, riducendo la sua accuratezza di 5 punti.
- •Entrambi i modelli sono disponibili in ChatGPT Work e Codex per gli utenti Plus, Pro, Business, Enterprise ed Edu e tramite le API come gpt-6-sol e gpt-6-luna, con Luna accessibile anche agli utenti Free e Go tramite l'app desktop.

OpenAI ha rilasciato GPT-6 Sol e GPT-6 Luna, ampliando la sua famiglia di modelli GPT-6 alongside il flagship GPT-6 Astra, presentato all'inizio di questo mese. L'azienda afferma che i nuovi modelli offrono prestazioni vicine al livello di Astra nel lavoro professionale, nell'accuratezza fattuale, nella programmazione e nell'uso del computer, riducendo al contempo i prezzi API del 50% rispetto ai prezzi promozionali della precedente generazione GPT-5.6.
OpenAI ha attribuito i prezzi più bassi ai miglioramenti nell'infrastruttura di caching e inferenza, affermando che i risparmi obtained vengono trasferiti direttamente agli utenti. GPT-6 Sol ora costa 2 dollari per milione di token di input e 10 dollari per milione di token di output, rispetto ai precedenti 4 e 20 dollari. GPT-6 Luna costa 0,10 dollari per milione di token di input e 0,50 dollari per milione di token di output, rispetto ai prezzi precedenti di 0,20 e 1,20 dollari. Poiché la fatturazione API scala con il volume di token, le tariffe per token rappresentano la principale leva di costo per gli sviluppatori, e la loro riduzione della metà si moltiplica sui grandi volumi di token che i carichi di lavoro agentici possono generare.
OpenAI descrive Astra come il suo modello con le capacità più elevate per i progetti più esigenti, mentre Sol e Luna sono pensati per rendere l'IA avanzata più pratica per carichi di lavoro quotidiani e di volume superiore.
GPT-6 Sol and Luna just landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV — OpenAI Developers (@OpenAIDevs) September 22, 2026
GPT-6 Sol and Luna landed in Astra’s orbit. Both launch today with API prices 50% lower than GPT-5.6. Build with Sol. Scale with Luna. To production and beyond. pic.twitter.com/ZCEFp4JdjV
Risultati dei benchmark e miglioramenti tecnici
Su AutomationBench, che valuta gli agenti su 47 strumenti aziendali in vendita, marketing, operazioni, supporto, finanza e risorse umane, GPT-6 Sol con effort xhigh ha ottenuto il 33,2% a un costo di 0,27 dollari per task. A confronto, il 26,9% di Claude Opus 5 con effort massimo, mentre il costo per task di Sol era circa il 9% di quello di Claude Opus 5. I confronti di costo per task di questo tipo sono diventati un elemento standard dei rilasci di modelli frontiera, accanto ai punteggi principali dei benchmark.
Su Agents' Last Exam, Sol con effort massimo ha raggiunto un punteggio del 56,4%, superando il miglior risultato di Claude Opus 5 a un costo inferiore di circa il 60%. Nelle valutazioni di programmazione, GPT-6 Sol ha ottenuto il 68,8% su DeepSWE v1.1, a 1,1 punti percentuali dal miglior risultato di Claude Fable 5 con un costo inferiore di circa l'80%. Luna ha ottenuto il 66,6%, comparabile a Opus 5 e Fable 5 con effort medio, con un costo inferiore del 93–96%. Su OSWorld 2.0, Sol ha eguagliato Claude Opus 5, con il 60,5% contro il 60,3%, a circa un quinto del costo.
OpenAI ha inoltre riferito che il tasso di errori fattuali di Sol è stato dimezzato rispetto al predecessore in una valutazione interna di conversazioni de-identificate in cui gli utenti avevano segnalato errori. Con effort più elevato, Luna ha eguagliato l'affidabilità di GPT-5.6 Sol a circa un centesimo del costo. Le valutazioni di allineamento hanno mostrato miglioramenti di entrambi i modelli rispetto ai predecessori, inclusi tassi più bassi di inganno in scenari di programmazione deliberatamente difficili.
OpenAI ha anche potenziato il prompt caching per aumentare i tassi di cache hit predefiniti. Il sistema offre uno sconto del 90% sulle letture di token di input in cache e include una dashboard di monitoraggio, strumenti diagnostici e controlli che consentono agli sviluppatori di regolare l'effort di ragionamento e la disponibilità degli strumenti senza invalidare il contesto in cache. GitHub ha riferito che queste modifiche hanno ridotto la quota di token di prompt che richiedono elaborazione ex novo di oltre il 50 su miliardi di richieste.
GPT-6 Sol e Luna sono disponibili in ChatGPT Work e Codex per gli utenti Plus, Pro, Business, Enterprise ed Edu. Luna è accessibile anche agli utenti Free e Go tramite l'app desktop. Entrambi i modelli sono offerti tramite le API come gpt-6-sol e gpt-6-luna, con un rollout graduale durante la giornata.
L'analisi indipendente conferma i risparmi sui costi ma rileva prestazioni miste
I test di terze parti condotti da Artificial Analysis hanno confermato in linea generale le dichiarazioni di efficienza di OpenAI, ma hanno offerto una valutazione più articolata delle capacità dei modelli. Utilizzando il suo Intelligence Index, la società ha rilevato che GPT-6 Sol con effort massimo costa circa 1,06 dollari per task, contro 1,99 dollari del predecessore. Il costo di Luna è sceso da 0,18 a 0,07 dollari per task. Artificial Analysis ha dichiarato che entrambi i modelli hanno raggiunto la frontiera di Pareto dell'efficienza dei costi.
La società ha precisato che i risparmi derivano interamente dalla riduzione dei prezzi, poiché entrambi i modelli hanno consumato leggermente più token di output per task rispetto ai loro predecessori.
GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN — Artificial Analysis (@ArtificialAnlys) September 22, 2026
GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Luna. Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others Pricing is approximately half that of… pic.twitter.com/eubnxPVsyN
I risultati delle prestazioni hanno mostrato sia progressi sia regressioni. Il punteggio di Sol nel Coding Agent Index è aumentato di 2 punti fino a 57, con guadagni su Terminal-Bench 4.0 e SWE-Atlas-QnA. Il punteggio di Luna è diminuito di 2 punti, con cali su SWE-Atlas-QnA e DeepSWE v1.1. Il quadro divergente rispetto ai dati del giorno di lancio di OpenAI riflette in parte le differenze nelle suite di benchmark, nei livelli di effort e nelle metodologie di punteggio tra i due set di risultati.
Sul benchmark AA-Omniscience, il tasso di allucinazioni di Sol è sceso dal 92% al 60%. Artificial Analysis ha osservato che il miglioramento è attribuibile in parte al modello che ha rifiutato di rispondere a più domande, il che ha ridotto la sua accuratezza di 5 punti. Questa distinzione — guadagni da un ancoraggio fattuale più solido rispetto a guadagni dal rispondere a meno domande — è una sfumatura ricorrente nella misurazione delle allucinazioni.
Le regressioni più significative sono emerse nelle valutazioni del lavoro cognitivo. Sol è sceso di circa 100 punti Elo su GDPval-AA v2.1, mentre Luna di circa 75 punti. L'ispezione manuale ha attribuito i punteggi inferiori a deliverable più brevi che omettevano elementi richiesti dalla rubrica e a una qualità espositiva ridotta. Letti insieme ai dati di OpenAI, i risultati indipendenti inquadrano questo lancio principalmente come una storia di costi: i prezzi sono scesi su tutta la linea, mentre il movimento delle capacità è variato a seconda del benchmark e della categoria di task.