AktualnościAkcjeAnthropic wprowadza Claude Sonnet 5.5, który koduje lepiej niż Opus 5.5 za połowę ceny

Anthropic wprowadza Claude Sonnet 5.5, który koduje lepiej niż Opus 5.5 za połowę ceny

Autor: Decrypt·

Najważniejsze informacje

  • •Claude Sonnet 5.5 debiutuje z niezmienioną ceną $2 za milion tokenów wejściowych i $10 za milion tokenów wyjściowych, czyli połową stawek Anthropic za Opus 5.5.
  • •Nowy model pokonał Opus 5.5 w testach kodowania Terminal-Bench 4.0, uzyskując 70.6% wobec 66.4% w wynikach Anthropic oraz 63.6% wobec 59.6% w niezależnym teście Artificial Analysis.
  • •Przy maksymalnym poziomie wysiłku Sonnet 5.5 wygenerował około 193,000 tokenów na zadanie — najwięcej spośród pomiarów Artificial Analysis — a koszt wyniósł $7.60 za zadanie, czyli około 50% więcej niż w przypadku Sonnet 5.
  • •Anthropic twierdzi, że model działa o ponad 30% szybciej niż Sonnet 5 i zużywa na zadanie prawie o jedną trzecią mniej tokenów, dzięki czemu jego uruchomienie jest tańsze mimo identycznych cen katalogowych.
  • •Claude Haiku 5.5, zaprojektowany do zastosowań o dużej skali i wrażliwych na koszty, ma pojawić się w ciągu najbliższych tygodni i uzupełnić linię modeli Anthropic generacji 5.5.
Anthropic wprowadza Claude Sonnet 5.5, który koduje lepiej niż Opus 5.5 za połowę ceny

Anthropic wprowadził w poniedziałek Claude Sonnet 5.5, najnowszą wersję swojego średniego modelu AI i aktualizację Sonnet 5, który zadebiutował w czerwcu. Ceny pozostają bez zmian: $2 za milion tokenów wejściowych i $10 za milion tokenów wyjściowych — połowa stawki pobieranej przez firmę za Opus 5.5.

Mimo niższej ceny model już uzyskuje lepsze wyniki w kodowaniu niż jego większy odpowiednik. W teście Terminal-Bench 4.0 Sonnet 5.5 zdobył 70.6%, wobec 66.4% dla Opus 5.5, według Anthropic. Artificial Analysis, niezależna firma testująca, przeprowadziła własną wersję testu i również umieściła Sonnet 5.5 przed Opus 5.5 — odpowiednio 63.6% do 59.6%. Mimo to firma plasuje go na swoim rankingu na drugim miejscu, za Opus 5.5, i zauważa, że model zużył więcej tokenów na zadanie niż jakikolwiek inny testowany model.

Anthropic twierdzi, że nowy model działa o ponad 30% szybciej niż jego poprzednik. "Sonnet 5.5 is strongest at well-scoped everyday tasks, fixing bugs, and creating polished documents, slides, and spreadsheets. It's also got a sharp eye for design," napisała firma.

Tokeny to fragmenty tekstu, które model AI odczytuje i zapisuje — nieco krótsze niż słowo — a firmy z sektora AI rozliczają je w milionach. Choć cena katalogowa jest taka sama jak w przypadku Sonnet 5, nowy model zużywa na zadanie prawie o jedną trzecią mniej tokenów, dzięki czemu jego uruchomienie jest tańsze niż poprzednika mimo identycznych stawek.

Model szczególnie dobrze radzi sobie z kodowaniem. Terminal-Bench 4.0 mierzy, czy agent AI potrafi samodzielnie wykonywać złożone zadania zawodowe, wpisując polecenia; wynik jest liczony jako odsetek ukończonych zadań. Sonnet 5.5 osiągnął 70.6%. Opus 5.5 uzyskał 66.4%, a Sonnet 5 zaledwie 10.3%. Mówiąc wprost, tańszy model ukończył więcej zadań.

Niezależny test Artificial Analysis potwierdził te wyniki: 63.6% dla Sonnet 5.5, 59.6% dla Opus 5.5 i 59.1% dla GPT-6 Astra firmy OpenAI. Firma zwróciła uwagę na postępy modelu w poście na X:

Claude Sonnet 5.5 (max) makes large strides on Terminal-Bench, sitting among the top models for both Terminal-Bench 4.0 and Terminal-Bench-Science. In Terminal-Bench 4.0 it scores 64%, a 50 point increase over Claude Sonnet 5 (max), and slightly above 60% for Opus 5.5 and GPT-6… pic.twitter.com/7CPrhgmfxe

— Artificial Analysis (@ArtificialAnlys) September 28, 2026

Wyniki zależą również od ustawienia wysiłku — suwaka, który sprawia, że model myśli dłużej, aby udzielić lepszej odpowiedzi, co oznacza też wyższy rachunek. Anthropic twierdzi, że Sonnet 5.5 przy ustawieniu High dorównuje GPT6 Sol w teście FrontierCode, a koszt pojedynczego zadania wynosi około jednej piątej kosztu w przypadku konkurencyjnego modelu.

W teście GDPval-AA, który ocenia rzeczywistą pracę zawodową w 44 profesjach za pomocą systemu Elo — znanego z szachów sposobu oceniania względnych umiejętności — Sonnet 5.5 uzyskał 1844 punkty, a Opus 5.5 1846, co oznacza praktycznie remis. GPT-6 Sol zdobył 1487 punktów.

Konkurenci oferują podobne ceny. W ubiegłym tygodniu OpenAI obniżyło cenę GPT-6 Sol do $2 i $10, podczas gdy średni model GPT-5.6 Terra kosztuje $2 i $12. Sonnet 5.5 i GPT-6 Sol mają obecnie identyczne ceny katalogowe — jednak, jak pokazują opisane wyżej ustawienia wysiłku, takie same stawki nie gwarantują identycznego kosztu pojedynczego zadania. Anthropic nie opublikował wyników testów porównawczych dla Terra.

Kompromis

Kompromisem jest rozwlekłość odpowiedzi. Sonnet 5.5 jest bardzo „rozmowny”: przy maksymalnym poziomie wysiłku generował około 193,000 tokenów na zadanie testowe — najwięcej spośród modeli zmierzonych przez Artificial Analysis i około 60% więcej niż Opus 5.5. Koszt wyniósł $7.60 za zadanie, czyli około 50% więcej niż w przypadku Sonnet 5, co podważa deklarację Anthropic o oszczędnościach sięgających 30%.

Deklarowane przez Anthropic oszczędności wynikają z niższych ustawień. Przy poziomie Medium, domyślnym w aplikacjach firmy, Anthropic twierdzi, że Sonnet 5.5 przewyższa najlepszy wynik kodowania Sonnet 5 za mniej niż jedną dziesiątą jego kosztu. Artificial Analysis ocenia, że najlepszą relację wartości do ceny zapewnia poziom High. Dla codziennych użytkowników oznacza to kodowanie zbliżone do możliwości flagowych modeli za ułamek ceny, o ile suwak pozostaje na niskim poziomie.

Pozostają jednak pewne zastrzeżenia. Tabela wyników Anthropic opiera się na danych zgłoszonych przez samą firmę, a Artificial Analysis testowało wersję przedpremierową zawierającą błąd, który według Anthropic miał niewielki wpływ na wyniki lub nieznacznie je zaniżył. To jeden z powodów, dla których warto obserwować niezależne rezultaty uzyskane na wersji produkcyjnej. Firma twierdzi również, że Opus 5.5 pozostaje wyraźnie lepszy w złożonych zadaniach wymagających długotrwałego osądu.

Claude Haiku 5.5, przeznaczony do zastosowań o dużej skali i wrażliwych na koszty, ma pojawić się w ciągu najbliższych tygodni i uzupełnić linię Anthropic generacji 5.5 wraz z Opus 5.5 i Sonnet 5.5.