Anthropic lancia Claude Sonnet 5.5, che supera Opus 5.5 nella programmazione alla metà del prezzo
Punti chiave
- •Claude Sonnet 5.5 debutta con prezzi invariati di 2 dollari per milione di token in input e 10 dollari per milione di token in output, la metà delle tariffe che Anthropic applica per Opus 5.5.
- •Il nuovo modello ha superato Opus 5.5 nei test di programmazione Terminal-Bench 4.0, con un punteggio del 70,6% contro il 66,4% nei risultati di Anthropic e del 63,6% contro il 59,6% nell'esecuzione indipendente di Artificial Analysis.
- •Al massimo sforzo, Sonnet 5.5 ha generato circa 193.000 token per attività, il valore più alto mai misurato da Artificial Analysis, a un costo di 7,60 dollari per attività—circa il 50% in più rispetto a Sonnet 5.
- •Anthropic afferma che il modello è oltre il 30% più veloce di Sonnet 5 e utilizza quasi un terzo di token in meno per attività, risultando più economico da far girare nonostante i prezzi di listino identici.
- •Claude Haiku 5.5, progettato per applicazioni ad alto volume e sensibili ai costi, è atteso nelle prossime settimane per completare la linea di prodotti 5.5 di Anthropic.

Anthropic ha rilasciato lunedì Claude Sonnet 5.5, la versione più recente del suo modello AI di fascia media e un aggiornamento di Sonnet 5, debuttato a giugno. I prezzi restano invariati: 2 dollari per milione di token in input e 10 dollari per milione di token in output—la metà di quanto l'azienda addebita per Opus 5.5.
Nonostante il prezzo più basso, il modello sta già superando il fratello maggiore nella programmazione. Su Terminal-Bench 4.0, Sonnet 5.5 ha ottenuto il 70,6% contro il 66,4% di Opus 5.5, secondo Anthropic. Artificial Analysis, una società di test indipendente, ha eseguito la sua versione del benchmark e ha anch'essa posizionato Sonnet 5.5 avanti, 63,6% contro 59,6%. L'azienda lo classifica tuttavia secondo in assoluto dietro Opus 5.5 nella sua classifica e rileva che ha utilizzato più token per attività rispetto a qualsiasi modello testato.
Anthropic afferma che il nuovo modello è oltre il 30% più veloce del predecessore. "Sonnet 5.5 è più forte nelle attività quotidiane ben definite, nella correzione di bug e nella creazione di documenti, presentazioni e fogli di calcolo rifiniti. Ha anche un occhio attento al design", ha scritto l'azienda.
I token sono i blocchi di testo che un modello AI legge e scrive—leggermente più corti di una parola—e le aziende di AI fatturano a milioni. Sebbene il prezzo di listino corrisponda a quello di Sonnet 5, il nuovo modello utilizza quasi un terzo di token in meno per attività, il che significa che risulta più economico da far girare rispetto al predecessore nonostante le tariffe identiche.
Dove il modello eccelle davvero è nella programmazione. Terminal-Bench 4.0 misura se un agente AI riesce a completare attività professionali complesse digitando comandi in autonomia, con punteggi calcolati come percentuale di attività completate. Sonnet 5.5 ha raggiunto il 70,6%. Opus 5.5 ha ottenuto il 66,4%, mentre Sonnet 5 si è fermato al 10,3%. In termini semplici, il modello più economico ha completato più lavori.
L'esecuzione indipendente di Artificial Analysis concorda: 63,6% per Sonnet 5.5, 59,6% per Opus 5.5 e 59,1% per GPT-6 Astra di OpenAI. L'azienda ha evidenziato i progressi del modello in un post su X:
Claude Sonnet 5.5 (max) makes large strides on Terminal-Bench, sitting among the top models for both Terminal-Bench 4.0 and Terminal-Bench-Science. In Terminal-Bench 4.0 it scores 64%, a 50 point increase over Claude Sonnet 5 (max), and slightly above 60% for Opus 5.5 and GPT-6… pic.twitter.com/7CPrhgmfxe
— Artificial Analysis (@ArtificialAnlys) September 28, 2026
I punteggi dipendono anche dall'impostazione dello sforzo, un parametro che induce il modello a riflettere più a lungo per una risposta migliore—e una bolletta più salata. Anthropic afferma che Sonnet 5.5 al livello High di sforzo eguaglia GPT6 Sol su FrontierCode per circa un quinto del costo per attività.
Su GDPval-AA, che valuta il lavoro professionale nel mondo reale in 44 occupazioni utilizzando Elo—il sistema di valutazione in stile scacchi che classifica l'abilità relativa—Sonnet 5.5 ha ottenuto 1844 contro il 1846 di Opus 5.5, di fatto un pareggio. GPT-6 Sol ha totalizzato 1487.
Anche i concorrenti allineano i prezzi. OpenAI ha ridotto GPT-6 Sol a 2 e 10 dollari la settimana scorsa, mentre GPT-5.6 Terra, il suo modello di fascia media, è quotato a 2 e 12 dollari. Sonnet 5.5 e GPT-6 Sol hanno ora prezzi di listino identici—tuttavia, come mostrano le impostazioni di sforzo sopra, tariffe identiche non garantiscono costi per attività equivalenti. Anthropic non ha pubblicato dati di benchmark per Terra.
Il rovescio della medaglia
Il compromesso è la verbosità. Sonnet 5.5 è un gran chiacchierone: al massimo sforzo ha scritto circa 193.000 token per attività di test, il valore più alto mai misurato da Artificial Analysis e circa il 60% in più rispetto a Opus 5.5. Il costo è arrivato a 7,60 dollari per attività, circa il 50% in più rispetto a Sonnet 5—un risultato che smentisce la dichiarazione di Anthropic di risparmi fino al 30%.
Le dichiarazioni di risparmio di Anthropic si basano su impostazioni più basse. Al livello Medium, l'impostazione predefinita nelle sue app, l'azienda afferma che Sonnet 5.5 supera il miglior punteggio di programmazione di Sonnet 5 per meno di un decimo del costo. Artificial Analysis sostiene che il livello High offra il miglior rapporto qualità-prezzo. Per gli utenti comuni, ciò significa programmazione quasi ai livelli dei modelli di punta a una frazione del prezzo, purché il parametro resti basso.
Restano alcune riserve. La tabella di benchmark di Anthropic è auto-dichiarata, e Artificial Analysis ha testato una build pre-rilascio con un bug che, secondo Anthropic, ha cambiato poco o ha leggermente sottovalutato i punteggi—uno dei motivi per cui vale la pena seguire i risultati indipendenti sulla build finale. L'azienda afferma inoltre che Opus 5.5 rimane chiaramente più forte nei lavori complessi che richiedono un giudizio costante.
Claude Haiku 5.5, progettato per applicazioni ad alto volume e sensibili ai costi, è previsto nelle prossime settimane e completerà la linea di prodotti 5.5 di Anthropic accanto a Opus 5.5 e Sonnet 5.5.