Anthropics neues Claude Opus 5.5 erreicht das Niveau von Fable bei 60 % des Preises - Decrypt
Wichtige Erkenntnisse
- •Opus 5.5 kostet pro Token 4 US-Dollar für Eingaben und 20 US-Dollar für Ausgaben—20 % unter dem Vorgänger und 60 % unter dem Flaggschiff Fable 5.1; die Cache-Lesekosten sinken um 60 % auf 0,20 US-Dollar pro Million Tokens.
- •Anthropics Benchmarks platzieren Opus 5.5 bei Coding- und Wissensarbeit-Tests vor Fable 5.1 und Opus 5, darunter eine Abschlussquote von 66,4 % bei Terminal-Bench 4.0 und ein Elo-Score von 1846 bei GDPval-AA v2.1.
- •GPT-6 Astra liegt bei AutomationBench mit 41,4 % zu 40,0 % und bei Terminal-Bench-Science 0.1 mit 64,6 % zu 58,7 % weiterhin vor Opus 5.5.
- •Das Modell startet mit denselben Sicherheitsvorkehrungen für Cybersicherheit und Biologie wie Fable 5.1; die meisten Cybersicherheits-Aufgaben werden weiterhin automatisch an das ältere Opus 4.8 weitergeleitet.
- •Opus 5.5 ist das dritte Modell in Flaggschiff-Klasse, das Anthropic seit dem Sommer veröffentlicht hat, nachdem CEO Dario Amodei einen Essay veröffentlicht hatte, in dem er die Branche aufforderte, das Tempo der KI-Fähigkeitsverbesserungen zu verlangsamen.

Anthropic hat Claude Opus 5.5 am Dienstag veröffentlicht, das erste Modell der sogenannten Claude-5.5-Familie des Unternehmens. Das Modell kostet 4 und 20 US-Dollar pro Million Eingabe- bzw. Ausgabe-Tokens—40 % günstiger als Opus 5 bei Standardeinstellungen—und Anthropic sagt, es erreiche auf den meisten Aufgaben das Niveau des teuersten Flaggschiffs Claude Fable 5.1.
Nach Anthropics eigenen Zahlen liegt Opus 5.5 bei Coding- und Wissensarbeit-Tests sowohl vor Fable 5.1 als auch vor dem Vorgänger Opus 5, wobei GPT-6 Astra bei AutomationBench und Terminal-Bench-Science 0.1 weiterhin die Nase vorn hat. Das neue Modell startet mit denselben Sicherheitsvorkehrungen für Cybersicherheit und Biologie wie Fable 5.1.
Die Veröffentlichung unterbietet sowohl das ersetzte Modell als auch das verfolgte Flaggschiff: Opus 5.5 ist 20 % günstiger im Betrieb als Opus 5 und 60 % günstiger als Fable 5.1, das modernste Angebot des Unternehmens.
Das Modell ist Anthropics fortschrittlichstes, sowohl nach Version (5.5 gegenüber Fables 5.1) als auch nach Familienebene—Opus ist das größte öffentlich verfügbare Modell, gefolgt von Sonnet, wobei Haiku das kleinste ist. Anthropic räumt ein, dass der reale Abstand zwischen Fable und Opus geringer ist, als die Benchmark-Werte vermuten lassen, doch die öffentliche Verfügbarkeit von Opus über kostenpflichtige Pläne und die niedrigeren Token-K machen es für die meisten Claude-Nutzer zur naheliegenden Wahl.
Die beiden Produktlinien haben sich in diesem Jahr die Führung abgewechselt. Opus 5 kam im Juli auf den Markt und unterbot sowie übertraf Fable 5 bei den meisten Benchmarks. Fable 5.1 erschien Anfang September und drehte den Spieß um, indem es Opus 5 in jedem von Anthropic veröffentlichten Benchmark schlug. Opus 5.5 schließt die Lücke erneut—diesmal über den Preis statt über die Rohwerte.
Lovable, eine Entwicklerplattform, die Opus 5 im Juli durch ihre eigenen Coding-Tests geschickt hatte, erklärte in einer von Anthropic geteilten Stellungnahme, das frühere Modell sei "stabiler, mit deutlich weniger Streuung von Lauf zu Lauf" gewesen als sein Vorgänger—dieselbe Effizienz-Aussage, die Anthropic jetzt erneut macht.
Opus 5.5 ist auch das erste Modell, das Anthropic veröffentlicht hat, seit CEO Dario Amodei einen Essay veröffentlichte, in dem er die Branche zur Verlangsamung aufrief, mit der Begründung, dass die Zuwächse bei den KI-Fähigkeiten den Sicherheitstests davonlaufen, die sie im Zaum halten sollen. "Wir müssen das Tempo verlangsamen, mit dem wir die Fähigkeiten von KI-Modellen verbessern", schrieb Amodei Anfang dieses Monats. Anthropic hat seit dem Sommer drei Modelle in Flaggschiff-Klasse veröffentlicht—Opus 5 im Juli, Fable 5.1 Anfang September und Opus 5.5 am Dienstag—genau das Tempo, das der Essay zu drosseln plädiert.
Anthropic misst einen Großteil dieses Fortschritts anhand von agentischem Coding—Arbeiten, die ein KI-Agent ausführt, ein Modell, das mehrstufige Aktionen eigenständig durchführt, statt lediglich auf eine einzelne Eingabe zu antworten.
Bei Terminal-Bench 4.0, das prüft, ob ein Agent komplexe professionelle Aufgaben in einer Kommandozeilen-Umgebung abschließen kann und die Ergebnisse als Prozentsatz der abgeschlossenen Aufgaben bewertet, erreichte Opus 5.5 66,4 %, vor Fable 5.1 mit 55,8 % und GPT-6 Astra mit 57,9 %. FrontierCode, das mit derselben Bestehens prüft, ob die Codeänderungen eines Agents tatsächlich in einer echten Engineering-Pipeline gemerged würden, setzte Opus 5.5 auf 54,4 % gegenüber 50,3 % für Fable 5.1.
Bei GDPval-AA v2.1, das reale Berufsarbeit in 44 Berufen mithilfe von Elo bewertet—dem schachartigen Ranglistensystem, das relative Fähigkeit misst statt eines flachen Prozentsatzes—erreichte Opus 5.5 1846, gegenüber 1735 für Fable 5.1 und 1708 für Opus 5.
Opus 5.5 führt allerdings nicht überall. Bei AutomationBench, einem von Zapier entwickelten Benchmark, der bewertet, ob ein Agent einen vollständigen Geschäftsworkflow von Anfang bis Ende ohne menschliche Hilfe durchführen kann, setzt sich GPT-6 Astra mit 41,4 % knapp gegen Opus 5.5 mit 40,0 % durch. Bei Terminal-Bench-Science 0.1, das agentische wissenschaftliche Forschung in einer Kommandozeilen-Umgebung mit derselben Bestehensquote testet, schlägt Astras 64,6 % Opus 5.5 mit 58,7 % deutlicher.
Das größere Verkaufsargument ist der Preis. Eingabe-Tokens—die Textabschnitte, die ein Modell liest und schreibt, abgerechnet pro Million—kosten jetzt 4 US-Dollar für Opus 5.5 gegenüber 5 US-Dollar für Opus 5, und Ausgabe-Tokens sinken von 25 auf 20 US-Dollar. Cache-Lesevorgänge—die Wiederverwendung bereits verarbeiteten Kontexts statt einer Neuberechnung von Grund auf und der größte Kostentreiber langer agentischer Coding-Sitzungen—sinken um 60 % auf 0,20 US-Dollar pro Million Tokens. Die Struktur lässt den Rabatt dort zusammenwirken, wo es zählt: Länge agentische Coding-Sitzungen werden überwiegend über Cache-Lesevorgänge abgerechnet, sodass die stärkste Kürzung beim größten Posten ansetzt.
Da Opus 5.5 bei diesen beiden Fähigkeiten das Niveau von Anthropics Mythos-Klasse-Modellen erreicht—der am stärksten eingeschränkten Stufe des Unternehmens, die für geprüfte Cybersicherheits- und Biologie-Forscher vorbehalten ist—startet es mit denselben Schutzvorkehrungen wie Fable 5.1. Die meisten Cybersicherheits-Aufgaben werden automatisch an das ältere Opus 4.8 weitergeleitet, eine Praxis über die sich viele Entwickler und Nutzer bereits beschwert haben. Ob die Ankunft von Opus 5.5 diese Weiterleitungspraxis ändert, bleibt abzuwarten.
Opus 5. ist jetzt auf Anthropics Plattformen live, darunter Amazon Web Services, Google Cloud und Microsoft Azure. Sonnet 5.5 und Haiku 5.5 folgen laut Anthropic in den kommenden Wochen und tragen dieselben Preissenkungen durch die restliche Produktpalette.