Anthropic lancia Claude Fable 5.1, più che raddoppiando il predecessore nel benchmark chiave
Punti chiave
- •Fable 5.1 ha segnato il 52,6% su Terminal-Bench-Science 0.1, più del doppio del 24,7% di Fable 5, e il 55,8% su Terminal-Bench 4.0, davanti al 52,3% di Opus 5.
- •I costi delle letture dalla cache sono calati del 75%, riducendo i costi dei carichi di lavoro tipici di circa il 25% e quelli altamente agentici fino al 45%, mentre i prezzi base restano di 10 dollari in input e 50 in output per milione di token.
- •Fable 5.1 è escluso dai piani Pro e dai posti Team standard, che si basano su crediti pay-as-you-go; i piani Max e i posti premium Team o Enterprise lo includono fino al 50% dei limiti di utilizzo settimanali.
- •Mythos 5.1 condivide lo stesso modello sottostante di Fable 5.1 ma con filtri di sicurezza diversi, e l'accesso è limitato ai professionisti verificati di cybersecurity e scienze della vita tramite i programmi di verifica di Anthropic.
- •Fable 5.1 batte Opus 5 in ogni benchmark pubblicato ma costa il doppio per token, a 10/50 dollari contro i 5/25 dollari per milione di token di Opus 5.

Anthropic ha rilasciato Claude Fable 5.1 e Claude Mythos 5.1 il 1° settembre, il primo aggiornamento della linea di modelli Mythos dal lancio di Fable 5 il 9 giugno. Il nuovo modello ha ottenuto il 52,6% su Terminal-Bench-Science 0.1, contro il 24,7% di Fable 5, e il 55,8% su Terminal-Bench 4.0, in crescita rispetto al 42,0%. Il rilascio prosegue un pattern del mercato dei modelli di frontiera, dove OpenAI, Google e Anthropic hanno lanciato quest'anno aggiornamenti successivi dei propri modelli di punta, usando i delta sui benchmark principali come principale metro di confronto competitivo.
Le letture dalla cache ora costano il 75% in meno, riducendo i costi dei carichi di lavoro tipici di circa il 25% e quelli dei carichi altamente agentici fino al 45%. I prezzi base restano invariati a 10 dollari in input e 50 dollari in output per milione di token. Il prompt caching—riutilizzare l'input già elaborato invece di rielaborarlo a ogni chiamata—è diventato un leva di costo standard presso i principali fornitori di modelli, poiché i flussi agentici, che ripetono contesti lunghi su molti passaggi, fanno salire le fatture.
Fable 5.1 non è incluso nei piani Pro né nei posti Team standard, che lo eseguono a credito in base all'uso. I piani Max e i posti premium Team o Enterprise lo includono fino al 50% dei limiti settimanali. Questa suddivisione conta per gli sviluppatori che scelgono dove instradare i carichi di lavoro: il costo effettivo di un modello dipende tanto dal piano in cui viene eseguito quanto dalle tariffe per token dichiarate.
Anthropic sostiene che i nuovi modelli sono "i più avanzati al mondo per il coding e il lavoro di conoscenza". Il rilascio arriva a tre mesi da un ciclo di lanci che ha già visto uno shutdown di 18 giorni per controlli alle esportazioni, una battaglia sui prezzi a metà estate riguardo all'accesso in abbonamento e un rilascio di Claude Opus 5 a luglio che ha superato Fable 5 sul prezzo.
Secondo Anthropic, Fable 5.1 e Mythos 5.1 sono lo stesso modello sottostante con filtri di sicurezza differenti applicati. Fable 5.1 è generalmente disponibile a chiunque abbia un account Claude. Mythos 5.1 resta riservato ai professionisti verificati di cybersecurity e scienze della vita attraverso il Cyber Verification Program e il Life Sciences Verification Program di Anthropic, successore del canale di accesso Project Glasswing che regolava l'accesso a Mythos 5.
Cosa misurano realmente i benchmark
Il dato principale di Anthropic deriva da Terminal-Bench-Science 0.1, un benchmark che verifica se un agente IA riesce a svolgere compiti di ricerca scientifica all'interno di un ambiente a riga di comando, con punteggio espresso come tasso di superamento. Fable 5.1 ha raggiunto il 52,6%, contro il 24,7% di Fable 5 e il 29,0% di Opus 5—più del doppio del predecessore.
Terminal-Bench 4.0 mette alla prova il coding agentico eseguito tramite terminale—scrivere, eseguire e fare debug di codice in sessioni a riga di comando multi-step—con punteggio espresso come percentuale di compiti completati correttamente. Fable 5.1 ha totalizzato il 55,8%, in crescita rispetto al 42,0% di Fable 5 e davanti al 52,3% di Opus 5. L'enfasi sui compiti multi-step via terminale riflette il passaggio del settore dalle risposte chat a turno singolo verso agenti capaci di sostenere lunghi flussi di lavoro autonomi—uno spostamento che ha reso i benchmark agentici un metro comune nei recenti lanci di frontiera.
Mythos 5.1, eseguito con filtri di cybersecurity più leggeri, ha segnato il 60,9% nello stesso test. Anthropic afferma che il divario riflette i compiti intercettati dalle sue salvaguardie e reindirizzati a Opus 4.8.
Su Humanity's Last Exam—un test di ragionamento multidisciplinare costruito da domande di livello esperto in decine di campi accademici, con punteggio come tasso di superamento—Fable 5.1 ha raggiunto il 60,9% senza strumenti esterni e il 65,0% con essi, entrambi davanti a Opus 5, il che lo rende il modello Anthropic più avanzato per scopi accademici.
Dove batte Opus 5, e dove i conti si complicano
Opus 5 è stato lanciato a luglio a metà del prezzo per token di Fable 5, superando Fable 5 nella maggior parte dei benchmark principali e rendendo di fatto ridondante il modello di punta per la maggior parte degli utenti paganti. Fable 5.1 ribalta la situazione: ora batte Opus 5 in ogni benchmark pubblicato da Anthropic, inclusi quelli in cui Opus 5 aveva precedentemente superato Fable 5.
Ma Fable 5.1 costa ancora il doppio per token rispetto a Opus 5—10 dollari in input e 50 in output contro i 5 e i 25 dollari di Opus 5. I token sono l'unità base di informazione che un modello può gestire, in genere circa due terzi di una parola inglese media, e le aziende pagano in base all'uso perché i carichi intensivi esauriscono rapidamente le quote dei piani in abbonamento. La questione prezzo-contro-prestazioni—se un modello più piccolo ed economico sia sufficiente—è oggi una scelta che gli acquirenti affrontano regolarmente nell'offerta di ogni grande fornitore, non solo di Anthropic.
La proposta di Anthropic per il modello si basa sui livelli di sforzo più che sui punteggi grezzi: l'azienda afferma che eseguire Fable 5.1 con sforzo di ragionamento basso o medio eguaglia o supera i vecchi risultati di Fable 5 a un costo molto inferiore, riservando i livelli di sforzo massimi ai problemi che bloccano tutto il resto. Per il lavoro di routine, più si abbassa il livello di sforzo, più si indebolisce l'argomento per saltare del tutto Opus 5.
L'accesso segue la stessa suddivisione applicata a Fable 5 dopo mesi di modifiche ai termini da parte di Anthropic. Sui piani Pro e sui posti standard Team o Enterprise, Fable 5.1 attinge interamente a crediti pay-as-you-go fatturati alla tariffa API, dato che non rientra nei limiti settimanali di quei piani. Sui piani Max e sui posti premium Team o Enterprise, è incluso come parte standard dell'abbonamento fino al 50% dell'utilizzo settimanale.
Claude Fable 5.1 è disponibile da subito su Claude API, Amazon Bedrock, Google Cloud e Microsoft Foundry, con l'ID modello "claude-fable-5-1" (Anthropic). La disponibilità su più piattaforme cloud rispecchia la modalità di distribuzione storicamente adottata da Anthropic, che consente ai clienti enterprise di eseguire i modelli nei contratti cloud esistenti anziché solo tramite l'API di Anthropic.