Claude Sonnet 5.5 conquista il terzo posto nella classifica Agent Arena
Punti chiave
- •Claude Sonnet 5.5 è entrato in Agent Arena di Arena.ai al terzo posto con un punteggio netto di miglioramento del 12,52%, dietro ad altri due modelli Anthropic: Claude Fable 5.1 (Max) al 14,31% e Claude Opus 5.5 (High) al 13,82%.
- •Il modello ha battuto di poco GPT-6 Astra (Max) di OpenAI, quarto al 12,27%, ma il divario di 0,25 punti è inferiore al margine di errore di Sonnet 5.5, pari a più o meno 3,09%, quindi la classifica può cambiare.
- •Su Terminal-Bench 4.0, Sonnet 5.5 ha ottenuto il 70,6%, un forte aumento rispetto al circa 10-14% del predecessore Sonnet 5, superando anche il 66,4% di Opus 5.5.
- •Sonnet 5.5 gira oltre il 30% più velocemente di Sonnet 5 mantenendo gli stessi prezzi di 2 dollari per milione di token di input e 10 dollari per milione di token di output, con una finestra di contesto di 1 milione di token.
- •Arena indica il costo di Sonnet 5.5 a 2,74 dollari per attività, e il maggiore consumo di token rispetto alla maggior parte dei concorrenti può determinarne la spesa effettiva per attività nei sistemi in produzione.

Il più recente modello di fascia media di Anthropic ha conquistato il terzo posto nella classifica Agent Arena di Arena.ai. Claude Sonnet 5.5, lanciato il 28 settembre 2026, ha registrato un punteggio netto di miglioramento del 12,5% — sufficiente a sopravanzare il miglior modello di OpenAI. Solo due modelli si trovano sopra di esso, e anch'essi sono realizzati da Anthropic.
Come si compone la classifica
Nei giorni successivi al rilascio, Sonnet 5.5 è salito al terzo posto di Agent Arena. Il suo punteggio netto di miglioramento è del 12,52%, con un margine di errore di più o meno 3,09%.
I due modelli che lo precedono sono Claude Fable 5.1 (Max) al 14,31% e Claude Opus 5.5 (High) al 13,82%. Immediatamente sotto si trova GPT-6 Astra (Max) di OpenAI al 12,27%. Con questi risultati, Anthropic occupa tre delle prime quattro posizioni della classifica.
Agent Arena valuta i modelli su milioni di attività agentiche del mondo reale, in cui un'IA deve utilizzare strumenti, completare lavori multi-fase e soddisfare utenti reali. La valutazione tiene conto dell'affidabilità degli strumenti, del completamento delle attività e del feedback degli utenti. Questo accentuato riflette una più ampia evoluzione del settore: man mano che i sistemi in produzione si affidano ai modelli per richiamare strumenti e svolgere lavori multi-fase, le classifiche dei modelli si contendono sempre più l'esecuzione end-to-end delle attività anziché la semplice risposta statica a domande.
Il costo è l'altro dato di rilievo. Arena indica Sonnet 5.5 a 2,74 dollari per attività, mentre le rilevazioni di inizio ottobre collocano il suo costo mediano intorno ai 2,78 dollari per attività. Il modello consuma inoltre più token rispetto alla maggior parte dei suoi concorrenti.
I benchmark oltre Arena
La buona prestazione di Sonnet 5.5 si estende anche ad altri benchmark. Nell'Artificial Analysis Intelligence Index ha ottenuto 56 punti, un secondo posto dietro a Opus 5.5 (Max).
Su Terminal-Bench 4.0, Sonnet 5.5 ha ottenuto il 70,6% — un netto balzo rispetto al predecessore Sonnet 5, che si era fermato circa tra il 10 e il 14% sullo stesso test. Il nuovo modello ha anche sopravanzato Opus 5.5, ferma al 66,4% su Terminal-Bench 4.0.
La velocità è migliorata: Sonnet 5.5 gira oltre il 30% più velocemente di Sonnet 5. I prezzi, però, non sono cambiati. Il modello costa ancora 2 dollari per milione di token di input e 10 dollari per milione di token di output, come prima. Sonnet 5.5 offre una finestra di contest di 1 milione di token e un output massimo di 128.000 token. Con prezzi per token invariati a fronte di velocità e punteggi in aumento, l'aggiornamento modifica l'equazione capacità-per-dollaro — sebbene l'elevato appetito di token del modello, visibile nei dati di Arena, resti la variabile che determina il costo reale per attività.
Cosa significa per la corsa dei modelli IA
La prima cosa da osservare è il margine di errore. Il punteggio di Sonnet 5.5 presenta un margine di più o meno 3,09%, e la distanza complessiva tra i primi quattro modelli è inferiore a questo valore. GPT-6 Astra (Max) segue Sonnet 5.5 a soli 0,25 punti percentuali. Con distacchi così ridotti, l'ordine può cambiare man mano che Arena aggrega più risultati delle attività, quindi la classifica va letta come un'istantanea attuale anziché una gerarchia consolidata.
Anche il consumo di token conta qui. Un uso più elevato di token può erodere il vantaggio di costo a seconda del carico di lavoro — un modello economico per token ma prolisso non è sempre economico per attività. Per i team che gestiscono agenti in produzione, quelle due colonne — punteggio e costo per attività — finiscono nello stesso foglio di calcolo, ed è per questo che ogni rilascio che rimodella la cima di classifiche come Agent Arena viene valutato su entrambi i piani.