Il nuovo Claude Opus 5.5 di Anthropic eguaglia Fable al 60% del prezzo - Decrypt
Punti chiave
- •I prezzi per token di Opus 5.5—4 dollari per l'input e 20 dollari per l'output—sono inferiori del 20% rispetto al predecessore e del 60% rispetto al flagship Fable 5.1, con i costi delle letture di cache in calo del 60% a 0,20 dollari per milione di token.
- •I benchmark di Anthropic collocano Opus 5.5 davanti sia a Fable 5.1 sia a Opus 5 nei test di coding e lavoro cognitivo, tra cui un tasso di completamento del 66,4% su Terminal-Bench 4.0 e un punteggio Elo di 1846 GDPval-AA v2.1.
- •GPT-6 A resta davanti a Opus 5.5 su AutomationBench, 41,4% contro 40,0%, e su Terminal-Bench-Science 0.1, 64,6% contro 58,7%.
- •Il modello è dotato delle stesse tutele di sicurezza informatica e biologia di Fable 5.1, e la maggior parte dei compiti di sicurezza informatica resta reindirizzata automaticamente al più datato Opus 4.8.
- •Opus 5.5 è il terzo modello di classe flagship rilasciato da Anthropic dall'estate, arrivato dopo che il CEO Dario Amodei ha pubblicato un saggio in cui esorta il settore a rallentare il ritmo dei progressi delle capacità dell'IA.

Anthropic ha rilasciato Claude Opus 5.5 martedì, il primo modello di quella che l'azienda chiama la sua famiglia Claude 5.5. Il modello ha un prezzo di 4 e 20 dollari per milione di token di input e output—il 40% in meno rispetto a Opus 5 con le impostazioni predefinite—e Anthropic afferma che eguaglia Claude Fable 5.1, il suo flagship più costoso, nella maggior parte dei compiti.
Secondo i numeri di Anthropic, Opus 5.5 precede sia Fable 5.1 sia il suo predecessore, Opus 5, nei test di coding e lavoro cognitivo, anche se GPT-6 Astra lo batte ancora su AutomationBench e Terminal-Bench-Science 0.1. Il nuovo modello debutta con le stesse tutele di sicurezza informatica e biologia di Fable 5.1.
Il rilascio undersella sia il modello che sostituisce sia il flagship che insegue: Opus 5.5 costa il 20% in meno da far girare rispetto a Opus 5 ed è il 60% più economico di Fable 5.1, l'offerta più avanzata dell'azienda.
Il modello è il più avanzato di Anthropic sia per versione (5.5 contro il 5.1 di Fable) sia per livello di famiglia—Opus è il modello più grande disponibile pubblicamente, seguito da Sonnet, con Haiku il più piccolo. Anthropic riconosce che il divario reale tra Fable e Opus è più ristretto di quanto suggeriscano i punteggi dei benchmark, ma la disponibilità pubblica di Opus nei piani a pagamento e il suo costo per token più basso ne fanno la ovvia per la maggior parte degli utenti di Claude.
Le due linee di prodotto si sono alternate alla guida quest'anno. Opus 5 è stato lanciato a luglio, sottocostando e superando Fable 5 nella maggior parte dei benchmark. Fable 5.1 è arrivato all'inizio di settembre e ha ribaltato la situazione, battendo Opus 5 su ogni benchmark pubblicato da Anthropic. Opus 5.5 colma nuovamente il divario—questa volta sul prezzo piuttosto che sui punteggi grezzi.
Lovable, una piattaforma per sviluppatori che ha sottoposto Opus 5 ai propri test di coding a luglio, ha dichiarato in una nota condivisa da Anthropic che il modello precedente era "più stabile, con una varianza da esecuzione a esecuzione molto inferiore" rispetto a quanto venuto prima—lo stesso argomento di efficienza che Anthropic sta proponendo di nuovo ora.
Opus 5.5 è anche il primo modello rilasciato da Anthropic da quando il CEO Dario Amodei ha pubblicato un saggio in cui chiede al settore di rallentare, sostenendo che i guadagni di capacità dell'IA stanno superando i test di sicurezza pensati per contenerli. "Dobbiamo rallentare il ritmo con cui miglioriamo le capacità dei modelli di IA", ha scritto Amodei all'inizio del mese. Anthropic ha ora rilasciato tre modelli di classe flagship dall'estate—Opus 5 a luglio, Fable 5.1 all'inizio di settembre e Opus 5.5 martedì—proprio il ritmo che il saggio sostiene debba rallentare.
Anthropic misura gran parte di questi progressi attraverso il coding agentico—lavoro svolto da un agente di IA, un modello che compie azioni multi-step in autonomia invece di limitarsi a rispondere a un singolo prompt.
Su Terminal-Bench 4.0, che verifica se un agente riesce a completare compiti professionali complessi all'interno di un'interfaccia a riga di comando e assegna un punteggio come percentuale di compiti completati, Opus 5.5 ha raggiunto il 66,4%, davanti al 55,8% di Fable 5.1 e al 57,9% di GPT-6 A. FrontierCode, che verifica se le modifiche al codice di un agente verrebbero effettivamente approvate in una pipeline ingegneristica reale usando lo stesso punteggio di pass-rate, ha attribuito a Opus 5.5 il 54,4% contro il 50,3% di Fable 5.1.
Su GDPval-AA v2.1, che valuta il lavoro professionale reale in 44 occupazioni usando Elo—lo stesso sistema di classificazione in stile scacchi che misura l'abilità relativa anziché una percentuale piatta—Opus 5.5 ha ottenuto 1846, contro i 1735 di Fable 5.1 e i 1708 di Opus 5.
Opus 5.5 però non guida ovunque. Su AutomationBench, un benchmark costruito da Zapier che valuta se un agente riesce a portare avanti un intero flusso di lavoro aziendale dall'inizio alla fine senza assistenza umana, il 41,4% di GPT-6 Astra supera di misura il 40,0% di Opus 5.5. Su Terminal-Bench-Science 0.1, che testa la ricerca scientifica agentica condotta in un ambiente a riga di comando con lo stesso metodo di pass-rate, il 64,6% di Astra batte il 58,7% di Opus 5.5 con un margine più ampio.
Il punto di forza principale è il costo. I token di input—i blocchi di testo che un modello legge e scrive, prezzati al milione—ora costano 4 dollari per Opus 5.5 contro i 5 dollari di Opus 5, e i token di output scendono da 25 a 20 dollari. Le letture di cache, che significano riutilizzare il contesto già elaborato da un modello invece di riprocessarlo da zero e generano la maggior parte dei costi nelle lunghe sessioni di coding agentico, scendono del 60% a 0,20 dollari per milione di token. La struttura fa sì che lo sconto si accumuli dove conta: le sessioni estese di coding agentico vengono fatturate soprattutto sulle letture di cache, quindi il taglio più incisivo si applica alla voce di costo più grande.
Poiché Opus 5.5 eguaglia i modelli di classe Mythos di Anthropic—il livello più restrittivo dell'azienda, riservato a ricercatori verificati di sicurezza informatica e biologia—su quelle due capacità, debutta con le stesse tutele di Fable 5.1. La maggior parte dei compiti di sicurezza informatica viene reindirizzata automaticamente al più datato Opus 4.8, una prassi di cui molti sviluppatori e utenti si sono già lamentati. Resta da vedere se l'arrivo di Opus 5.5 modifichi questo comportamento di reindirizzamento.
Opus 5.5 è ora disponibile sulle piattaforme di Anthropic, tra cui Amazon Web Services, Google Cloud e Microsoft Azure. Sonnet 5.5 e Haiku 5.5 seguiranno nelle prossime settimane, dichiara Anthropic, portando gli stessi tagli di prezzo al resto della gamma.