Anthropic wprowadza Claude Fable 5.1, ponad dwukrotnie poprawiając wynik poprzednika w kluczowym teście benchmarkowym
Najważniejsze informacje
- •Fable 5.1 zdobył 52,6% w teście Terminal-Bench-Science 0.1 — ponad dwukrotnie więcej niż Fable 5 z wynikiem 24,7% — oraz 55,8% w Terminal-Bench 4.0, wyprzedzając Opus 5 z 52,3%.
- •Koszty odczytów z cache spadły o 75%, co obniża typowe koszty zadań o około 25%, a wysoce agentowe obciążenia nawet o 45%; podstawowa cena pozostaje 10/50 dolarów za milion tokenów (wejście/wyjście).
- •Fable 5.1 nie jest objęty planami Pro ani standardowymi miejscami Team, które korzystają z kredytów pay-as-you-go; plany Max oraz premium Team lub Enterprise obejmują go do 50% tygodniowych limitów użycia.
- •Mythos 5.1 bazuje na tym samym modelu co Fable 5.1, ale z innymi filtrami bezpieczeństwa; dostęp mają wyłącznie zweryfikowani specjaliści ds. cyberbezpieczeństwa i nauk o życiu przez programy weryfikacyjne Anthropic.
- •Fable 5.1 wyprzedza Opus 5 we wszystkich opublikowanych benchmarkach, ale kosztuje dwa razy więcej za token — 10/50 dolarów wobec 5/25 dolarów u Opus 5 za milion tokenów.

Anthropic wydało Claude Fable 5.1 i Claude Mythos 5.1 1 września — to pierwsza aktualizacja linii modeli klasy Mythos od czasu premiery Fable 5 w dniu 9 czerwca. Nowy model uzyskał 52,6% w teście Terminal-Bench-Science 0.1 wobec 24,7% osiągniętych przez Fable 5 oraz 55,8% w Terminal-Bench 4.0, wzrost z 42,0%. Premiera kontynuuje tendencję na rynku modeli granicznych, gdzie OpenAI, Google i Anthropic wydają w tym roku kolejne flagowe aktualizacje, a różnice w wynikach benchmarków służą jako główne kryterium konkurencji.
Odczyty z cache kosztują teraz o 75% mniej, co obniża typowe koszty zadań o około 25%, a wysoce agentowe obciążenia nawet o 45%. Podstawowa cena pozostaje bez zmian: 10 dolarów za tokeny wejściowe i 50 dolarów za wyjściowe na milion tokenów. Buforowanie promptów — ponowne wykorzystanie wcześniej przetworzonych danych wejściowych zamiast ich ponownego przetwarzania przy każdym wywołaniu — stało się standardowym narzędziem obniżania kosztów u głównych dostawców modeli, ponieważ workflow agentowe, powtarzające długi kontekst w wielu krokach, podnoszą rachunki.
Fable 5.1 nie jest objęty planami Pro ani standardowymi miejscami Team, które korzystają z niego na kredytach użytkowania. Plany Max oraz premium Team lub Enterprise obejmują go do 50% limitów tygodniowych. Ta gradacja ma znaczenie dla programistów wybierających, gdzie kierować obciążenia: realny koszt modelu zależy zarówno od planu, w którym działa, jak i od publikowanych stawek za token.
Anthropic twierdzi, że nowe modele są najbardziej zaawansowanymi na świecie pod względem kodowania i pracy z wiedzą. Premiera przypada trzy miesiące po rozpoczęciu cyklu wydawniczego, który obejmował już 18-dniową blokadę z powodu kontroli eksportu, letni spór cenowy o dostęp w subskrypcji oraz lipcową premierę Claude Opus 5, który przebił Fable 5 cenowo.
Według Anthropic, Fable 5.1 i Mythos 5.1 to ten sam model bazowy z różnymi filtrami bezpieczeństwa. Fable 5.1 jest ogólnie dostępny dla każdego posiadacza konta Claude. Mythos 5.1 pozostaje ograniczony do zweryfikowanych specjalistów ds. cyberbezpieczeństwa i nauk o życiu poprzez programy Anthropic Cyber Verification Program i Life Sciences Verification Program, następcę ścieżki dostępu Project Glasswing, która chroniła dostęp do Mythos 5.
Co faktycznie mierzą benchmarki
Główny wynik Anthropic pochodzi z testu Terminal-Bench-Science 0.1 — benchmarku sprawdzającego, czy agent AI potrafi wykonywać zadania badawcze w środowisku wiersza poleceń, ocenianego jako wskaźnik zaliczeń. Fable 5.1 osiągnął 52,6% wobec 24,7% modelu Fable 5 i 29,0% modelu Opus 5 — ponad dwukrotnie więcej niż poprzednik.
Terminal-Bench 4.0 testuje kodowanie agentowe wykonywane przez terminal — pisanie, uruchamianie i debugowanie kodu w wieloetapowych sesjach wiersza poleceń — oceniane jako odsetek poprawnie wykonanych zadań. Fable 5.1 uzyskał 55,8%, wobec 42,0% Fable 5 i wyprzedził Opus 5 z wynikiem 52,3%. Nacisk na wieloetapowe zadania terminalowe odzwierciedla branżową zmianę fokusu z jednoturowych odpowiedzi czatu na agentów zdolnych do utrzymywania długich autonomicznych workflow — zmianę, która uczyniła benchmarki agentowe powszechną miarą w najnowszych premierach modeli granicznych.
Mythos 5.1, działający z lżejszymi filtrami cyberbezpieczeństwa, uzyskał w tym samym teście 60,9%. Anthropic tłumaczy, że różnica wynika z zadań przechwyconych przez zabezpieczenia i przekierowanych do Opus 4.8.
W teście Humanity's Last Exam — wielodyscyplinarnym sprawdzianie rozumowania opartym na pytaniach eksperckich z dziesiątek dziedzin akademickich, ocenianym jako wskaźnik zaliczeń — Fable 5.1 osiągnął 60,9% bez narzędzi zewnętrznych i 65,0% z ich użyciem, w obu przypadkach przed Opus 5, co czyni go najbardziej zaawansowanym modelem Anthropic do celów akademickich.
Gdzie wyprzedza Opus 5, a gdzie rachunek staje się mniej jasny
Opus 5 zadebiutował w lipcu w połowie ceny za token Fable 5, wyprzedzając go w większości głównych benchmarków, co czyniło flagowy model zbędnym dla większości płacących użytkowników. Fable 5.1 odwraca tę sytuację: teraz wyprzedza Opus 5 we każdym benchmarku opublikowanym przez Anthropic, również w tych, w których Opus 5 wcześniej wygrywał z Fable 5.
Fable 5.1 nadal jednak kosztuje dwa razy więcej za token niż Opus 5 — 10 dolarów za wejście i 50 za wyjście wobec 5 i 25 dolarów u Opus 5. Token to podstawowa ilość informacji, którą model może przetworzyć, zwykle około dwóch trzecich przeciętnego słowa w języku angielskim; firmy płacą za użycie, ponieważ intensywne workflow bardzo szybko wyczerpują limity w planach subskrypcyjnych. Pytanie o relację ceny do wydajności — czy mniejszy, tańszy model wystarczy — użytkownicy zadają dziś rutynowo w ofercie każdego dużego dostawcy, nie tylko Anthropic.
Argumentacja Anthropic za tym modelem opiera się na poziomach nakładu pracy, a nie surowych wynikach: firma twierdzi, że Fable 5.1 działający przy niskim lub średnim wysiłku rozumowania dorównuje lub przewyższa dawne wyniki Fable 5 przy znacznie niższym koszcie, a najwyższe poziomy wysiłku są zarezerwowane dla problemów, przed którymi zawodzą wszystkie inne modele. W przypadku rutynowej pracy argument za całkowitą rezygnacją z Opus 5 słabnie wraz ze zmniejszaniem poziomu wysiłku.
Dostęp odzwierciedla ten sam podział, który obowiązywał w przypadku Fable 5 po miesiącach dostosowywania warunków przez Anthropic. W planach Pro i standardowych miejscach Team lub Enterprise Fable 5.1 korzysta wyłącznie z kredytów pay-as-you-go rozliczanych według stawek API, ponieważ nie wchodzi w skład tygodniowych limitów tych planów. W planach Max oraz premium Team lub Enterprise jest objęty standardowo w ramach subskrypcji do 50% tygodniowego użycia.
Claude Fable 5.1 jest dostępny już teraz w Claude API, Amazon Bedrock, Google Cloud i Microsoft Foundry pod identyfikatorem modelu "claude-fable-5-1" (Anthropic). Dostępność na wielu platformach chmurowych odzwierciedla historyczny sposób dystrybucji modeli przez Anthropic, pozwalając klientom korporacyjnym uruchamiać je w ramach istniejących umów chmurowych, a nie wyłącznie przez API Anthropic.