Claude Opus 5.5 firmy Anthropic dorównuje flagowemu modelowi Fable 5.1 za 60% jego ceny
Najważniejsze informacje
- •Ceny Opus 5.5 wynoszą $4 za tokeny wejściowe i $20 za tokeny wyjściowe, czyli są odpowiednio o 20% niższe niż w przypadku poprzednika i o 60% niższe niż w przypadku flagowego Fable 5.1; koszt odczytów z pamięci podręcznej spadł o 60%, do $0.20 za milion tokenów.
- •Benchmarki Anthropic plasują Opus 5.5 przed Fable 5.1 i Opus 5 w testach programowania oraz pracy wymagającej wiedzy, w tym z wynikiem 66.4% w Terminal-Bench 4.0 i 1846 punktów Elo w GDPval-AA v2.1.
- •GPT-6 A nadal osiąga lepsze wyniki niż Opus 5.5 w AutomationBench — 41.4% wobec 40.0% — oraz w Terminal-Bench-Science 0.1 — 64.6% wobec 58.7%.
- •Model debiutuje z takimi samymi zabezpieczeniami w zakresie cyberbezpieczeństwa i biologii jak Fable 5.1, a większość zadań związanych z cyberbezpieczeństwem nadal jest automatycznie przekierowywana do starszego Opus 4.8.
- •Opus 5.5 jest trzecim modelem klasy flagowej wypuszczonym przez Anthropic od lata; jego premiera nastąpiła po opublikowaniu przez Dario Amodeiego eseju wzywającego branżę do spowolnienia tempa rozwoju możliwości AI.

Anthropic wypuścił we wtorek Claude Opus 5.5, pierwszy model z rodziny, którą firma nazywa Claude 5.5. Cena modelu wynosi $4 i $20 za milion tokenów wejściowych i wyjściowych — jest więc o 40% niższa niż w przypadku Opus 5 przy ustawieniach domyślnych — a Anthropic twierdzi, że pod względem większości zadań dorównuje Claude Fable 5.1, swojemu najdroższemu modelowi flagowemu.
Według własnych danych Anthropic Opus 5.5 wyprzedza zarówno Fable 5.1, jak i swojego poprzednika, Opus 5, w testach programowania oraz pracy wymagającej wiedzy, choć GPT-6 Astra nadal osiąga lepsze wyniki w AutomationBench i Terminal-Bench-Science 0.1. Nowy model debiutuje z takimi samymi zabezpieczeniami w zakresie cyberbezpieczeństwa i biologii jak Fable 5.1.
Nowa premiera oznacza niższą cenę zarówno względem zastępowanego modelu, jak i flagowej wersji, do której Opus 5.5 aspiruje: korzystanie z Opus 5.5 kosztuje o 20% mniej niż z Opus 5 i o 60% mniej niż z Fable 5.1, najbardziej zaawansowaną ofertą firmy.
Model jest najbardziej zaawansowanym rozwiązaniem Anthropic zarówno pod względem wersji (5.5 wobec 5.1 w przypadku Fable), jak i poziomu w rodzinie — Opus to największy publicznie dostępny model, po nim plasuje się Sonnet, a najmniejszy jest Haiku. Anthropic przyznaje, że rzeczywista różnica między Fable i Opus jest mniejsza, niż sugerują wyniki benchmarków, ale publiczna dostępność Opus w płatnych planach oraz niższy koszt pojedynczego tokena czynią go oczywistym wyborem dla większości użytkowników Claude.
Obie linie produktowe wymieniały się w tym roku pozycją lidera. Opus 5 zadebiutował w lipcu, oferując niższą cenę i lepsze wyniki niż Fable 5 w większości benchmarków. Fable 5.1 pojawił się na początku września i odwrócił tę sytuację, wyprzedzając Opus 5 we wszystkich benchmarkach opublikowanych przez Anthropic. Opus 5.5 ponownie zmniejsza różnicę — tym razem dzięki cenie, a nie surowym wynikom.
Lovable, platforma dla deweloperów, która w lipcu przeprowadziła własne testy programistyczne Opus 5, stwierdziła w oświadczeniu udostępnionym przez Anthropic, że wcześniejszy model był „stabilniejszy, z dużo mniejszą zmiennością między kolejnymi uruchomieniami” niż poprzednie rozwiązanie — to ten sam argument dotyczący efektywności, który Anthropic ponownie przedstawia teraz.
Opus 5.5 jest również pierwszym modelem wypuszczonym przez Anthropic od czasu, gdy dyrektor generalny Dario Amodei opublikował esej, w którym wezwał branżę do spowolnienia, argumentując, że rozwój możliwości AI wyprzedza testy bezpieczeństwa mające utrzymywać je pod kontrolą. „Musimy spowolnić tempo, w jakim zwiększamy możliwości modeli AI” — napisał Amodei na początku tego miesiąca. Od lata Anthropic wypuścił już trzy modele klasy flagowej — Opus 5 w lipcu, Fable 5.1 na początku września i Opus 5.5 we wtorek — czyli w tempie, które według eseju powinno zostać spowolnione.
Anthropic mierzy znaczną część tego postępu za pomocą programowania agentowego — pracy wykonywanej przez agenta AI, czyli model podejmujący samodzielnie wieloetapowe działania zamiast udzielać odpowiedzi na pojedynczy prompt.
W Terminal-Bench 4.0, który sprawdza, czy agent potrafi wykonać złożone zadania zawodowe w interfejsie wiersza poleceń, a wyniki ocenia jako odsetek ukończonych zadań, Opus 5.5 uzyskał 66.4%, wyprzedzając Fable 5.1 z wynikiem 55.8% i GPT-6 Astra z wynikiem 57.9%. FrontierCode, który sprawdza, czy zmiany w kodzie agenta zostałyby faktycznie zaakceptowane w rzeczywistym procesie inżynieryjnym, stosując tę samą metodę opartą na odsetku zaliczonych zadań, przyznał Opus 5.5 wynik 54.4% wobec 50.3% dla Fable 5.1.
W GDPval-AA v2.1, który ocenia rzeczywistą pracę zawodową w 44 profesjach za pomocą rankingu Elo — systemu w stylu szachowym mierzącego względne umiejętności, a nie wynik procentowy — Opus 5.5 uzyskał 1846 punktów, wobec 1735 dla Fable 5.1 i 1708 dla Opus 5.
Opus 5.5 nie prowadzi jednak we wszystkich testach. W AutomationBench, benchmarku stworzonym przez Zapier, który ocenia, czy agent potrafi przeprowadzić kompletny proces biznesowy od początku do końca bez pomocy człowieka, GPT-6 Astra nieznacznie wyprzedza Opus 5.5, uzyskując 41.4% wobec 40.0%. W Terminal-Bench-Science 0.1, który testuje agentowe badania naukowe prowadzone w środowisku wiersza poleceń przy użyciu tej samej metody oceny, Astra z wynikiem 64.6% wyprzedza Opus 5.5 z wynikiem 58.7% o większą różnicę.
Najważniejszym argumentem sprzedażowym jest koszt. Tokeny wejściowe — fragmenty tekstu odczytywane i zapisywane przez model, wyceniane za milion — kosztują teraz $4 w przypadku Opus 5.5 wobec $5 dla Opus 5, a tokeny wyjściowe tanieją z $25 do $20. Odczyty z pamięci podręcznej, czyli ponowne wykorzystywanie kontekstu przetworzonego już przez model zamiast przetwarzania go od początku, które generuje większość kosztów długich sesji programowania agentowego, tanieją o 60% do $0.20 za milion tokenów. Taka struktura sprawia, że oszczędności kumulują się tam, gdzie mają największe znaczenie: długie sesje programowania agentowego są rozliczane głównie na podstawie odczytów z pamięci podręcznej, więc największa obniżka dotyczy najważniejszej pozycji kosztowej.
Ponieważ Opus 5.5 dorównuje modelom Anthropic klasy Mythos — najbardziej ograniczonej kategorii firmy, zarezerwowanej dla zweryfikowanych badaczy zajmujących się cyberbezpieczeństwem i biologią — w tych dwóch obszarach, debiutuje z takimi samymi zabezpieczeniami jak Fable 5.1. Większość zadań związanych z cyberbezpieczeństwem jest automatycznie przekierowywana do starszego Opus 4.8, co wcześniej krytykowali liczni deweloperzy i użytkownicy. Nie wiadomo jeszcze, czy pojawienie się Opus 5.5 zmieni sposób działania tego przekierowania.
Opus 5.5 jest już dostępny na platformach Anthropic, w tym Amazon Web Services, Google Cloud i Microsoft Azure. Anthropic informuje, że w najbliższych tygodniach dołączą Sonnet 5.5 i Haiku 5.5, a obniżki cen obejmą pozostałą część oferty.