NotizieMacroClaude Opus 5 di Anthropic supera Fable 5 nella maggior parte dei benchmark a metà prezzo

Claude Opus 5 di Anthropic supera Fable 5 nella maggior parte dei benchmark a metà prezzo

Autore: Decrypt·

Punti chiave

  • Claude Opus 5 è stato lanciato il 24 luglio a $5 per milione di token di input, esattamente metà del prezzo di Fable 5, pur superandolo in quasi tutti i principali benchmark.
  • Opus 5 è ora il modello predefinito su Claude Max e l'opzione più potente su Claude Pro, sostituendo di fatto Fable 5 come modello di punta per gli abbonati di Anthropic dopo i problemi di controllo sulle esportazioni e le restrizioni solo a crediti affrontati da quel modello.
  • Su Frontier-Bench v0.1, Opus 5 ha ottenuto il 43.3%, superando Fable 5 al 33.7% e GPT-5.6 Sol di OpenAI al 34.4% nelle attività di ingegneria del software end-to-end.
  • Lovable ha riportato un miglioramento del 22% rispetto a Opus 4.7 nelle attività di coding agentico, mentre Zapier ha registrato un punteggio perfetto su AutomationBench per Opus 5 in un flusso completo di prevenzione del churn.
  • Il lancio è arrivato una settimana dopo che Moonshot AI, con sede a Pechino, ha introdotto Kimi K3, un modello open-weight da 2.8 trilioni di parametri che i benchmark indipendenti classificano al terzo posto complessivo dietro Fable 5 e GPT-5.6 Sol.
Claude Opus 5 di Anthropic supera Fable 5 nella maggior parte dei benchmark a metà prezzo

Anthropic ha rilasciato Claude Opus 5 il 24 luglio, con un prezzo di $5 per milione di token di input — identico al suo predecessore Opus 4.8 ed esattamente pari alla metà del costo di Fable 5 — superando al contempo Fable 5 nella maggior parte dei principali benchmark. Il nuovo modello è ora quello predefinito su Claude Max e l'opzione più potente su Claude Pro, sostituendo di fatto Fable 5 come scelta di riferimento per la maggior parte degli abbonati.

Opus 5 è meno costoso da utilizzare per le aziende rispetto al modello di punta di Anthropic, Claude Fable 5, che la società aveva posizionato come prodotto frontier quotidiano per gli utenti paganti. Supera inoltre Fable 5 in diversi benchmark rilevanti. Per le aziende che costruiscono prodotti su API di IA, dove i costi dei token crescono direttamente con il volume degli utenti, un modello che eguaglia o supera le prestazioni frontier a metà prezzo può incidere in modo significativo sull'economia unitaria.

La struttura dei livelli dei modelli di Anthropic

La gamma di Anthropic comprende quattro livelli. Haiku è veloce ed economico. Sonnet è di fascia media. Opus funge da modello più robusto per i carichi pesanti. Sopra questi si colloca la classe Mythos, un livello introdotto da Anthropic questa primavera, che include Claude Fable 5 per il pubblico e Claude Mythos 5, una versione con meno restrizioni disponibile tramite Project Glasswing per ricercatori di cybersicurezza verificati e operatori di infrastrutture critiche.

Fable 5 ha avuto un percorso turbolento come modello di punta per gli abbonati. È stato lanciato il 9 giugno, per poi essere ritirato a livello globale tre giorni dopo, quando il governo degli Stati Uniti ha emesso un ordine di controllo sulle esportazioni di emergenza citando una vulnerabilità di jailbreak. È tornato il 30 giugno, ma è passato immediatamente a un modello basato solo su crediti, non più incluso nei piani standard. Opus 5 ora occupa lo spazio che Fable 5 non è riuscito a mantenere.

Lovable, una piattaforma per sviluppatori con milioni di utenti, ha testato Opus 5 nelle proprie valutazioni interne e ha osservato che i miglioramenti vanno oltre i punteggi grezzi. "It isn't just better on our hardest agentic coding tasks, up 22% over Opus 4.7, it's steadier, with far less variance run to run," ha dichiarato Fabian Hedin in una nota condivisa da Anthropic.

Risultati dei benchmark

Opus 5 supera Fable 5 in quasi tutte le metriche rilevanti per gli utenti quotidiani, pur non avendo la designazione di classe Mythos.

Su Frontier-Bench v0.1 — un benchmark che verifica se agenti di coding IA riescano a completare attività reali di ingegneria del software dall'inizio alla fine, con punteggio espresso come percentuale di attività superate — Opus 5 ha raggiunto il 43.3%. Fable 5 ha ottenuto il 33.7%, mentre GPT-5.6 Sol di OpenAI, il principale rivale commerciale di Anthropic, ha segnato il 34.4%.

Il margine più ampio è emerso su ARC-AGI-3, un test di autentica risoluzione di problemi basato su puzzle inediti che un modello non avrebbe potuto memorizzare dai dati di addestramento, con punteggio espresso come percentuale di puzzle risolti. Opus 5 ha raggiunto il 30.2%; GPT-5.6 Sol ha ottenuto il 7.8%; Fable 5 non è stato testato.

Su GDPval-AA v2 — un benchmark per il lavoro della conoscenza valutato tramite rating Elo, il sistema di classificazione in stile scacchistico usato per misurare le prestazioni relative su attività professionali reali — Opus 5 ha raggiunto 1,861, rispetto a 1,747 di Fable 5 e 1,736 di GPT-5.6 Sol.

Zapier ha testato Opus 5 su AutomationBench, una valutazione che misura se un modello possa gestire un intero flusso di lavoro aziendale dall'inizio alla fine senza intervento umano. Il loro verdetto: il modello "took a raw account-health workbook and ran a full churn-prevention sequence end to end: flagging at-risk accounts, alerting the right owner, and summarizing for retention ops. Previous models didn't pass; Opus 5 hit 100%."

Anthropic sta inoltre posizionando Opus 5 come un miglioramento per la ricerca. Ultima Genomics, una società di sequenziamento del DNA, ha affermato che il modello "behaves more like a careful scientist than any model we've run. It reaches for the right statistical tests to rule out confounders, cross-checks its own results by independent methods, and stays on track through long multi-step analyses."

Detto questo, legale e salute sono gli unici due ambiti in cui Fable 5 eccelle con un margine ridotto.

Scenario competitivo più ampio

Il lancio arriva una settimana dopo che Moonshot AI, startup con sede a Pechino sostenuta da Alibaba, ha presentato Kimi K3 — un modello open-weight da 2.8 trilioni di parametri, il che significa che chiunque può scaricare il codice sottostante per eseguirlo in modo indipendente. Moonshot lo descrive come il più grande sistema di IA aperto al mondo. I benchmark indipendenti collocano costantemente Kimi K3 al terzo posto complessivo, dietro sia a Fable 5 sia a GPT-5.6 Sol, pur superando entrambi in aree specifiche. Questo approccio open-weight, in contrasto con il modello di accesso solo tramite API usato da Anthropic e OpenAI, consente alle organizzazioni di eseguire i modelli sul proprio hardware, anche se un sistema da 2.8 trilioni di parametri richiede risorse di calcolo considerevoli per funzionare.

Prezzi e disponibilità

Opus 5 è ora disponibile tramite API a $5 per milione di token di input e $25 per milione di token di output. (I token sono l'unità di base dell'informazione che un modello di IA elabora sia in input sia in output.) È disponibile anche una modalità Fast che opera a circa 2.5 volte la velocità predefinita, al doppio del prezzo base: $10 per milione di token di input e $50 per milione di output.

Il lancio potrebbe attenuare le preoccupazioni persistenti sulla disponibilità pubblica limitata di Fable 5. Opus 5 è accessibile anche tramite abbonamento per tutti gli utenti.