Claude Sonnet 5.5 belegt den dritten Platz auf Arenas Agent-Arena-Bestenliste
Wichtige Erkenntnisse
- •Claude Sonnet 5.5 trat auf Arena.ai's Agent Arena auf Platz drei ein, mit einem Netto-Verbesserungswert von 12,52 %, hinter zwei weiteren Anthropic-Modellen: Claude Fable 5.1 (Max) mit 14,31 % und Claude Opus 5.5 (High) mit 13,82 %.
- •Das Modell übertraf knapp OpenAIs GPT-6 Astra (Max), das mit 12,27 % auf Platz vier liegt, doch der Abstand von 0,25 Punkten ist kleiner als Sonnet 5.5s Fehlermarge von plus oder minus 3,09 %, sodass sich die Platzierungen ändern können.
- •Auf Terminal-Bench 4.0 erreichte Sonnet 5.5 70,6 %, ein starker Anstieg gegenüber den etwa 10–14 % des Vorgängers Sonnet 5, und übertraf zudem Opus 5.5 mit 66,4 %.
- •Sonnet 5.5 läuft mehr als 30 % schneller als Sonnet 5, bei unveränderten Preisen von 2 $ pro eine Million Input-Tokens und 10 $ pro eine Million Output-Tokens, mit einem Kontextfenster von einer Million Tokens.
- •Arena beziffert die Kosten von Sonnet 5.5 mit 2,74 $ pro Aufgabe; der im Vergleich zu den meisten Wettbewerbern höhere Token-Verbrauch kann die tatsächlichen Ausgaben pro Aufgabe in Produktionseinsätzen bestimmen.

Anthropics neuestes Mittelklasse-Modell hat den dritten Platz auf der Agent-Arena-Bestenliste von Arena.ai erobert. Claude Sonnet 5.5, das am 28. September 2026 erschien, erzielte einen Netto-Verbesserungswert von 12,5 % – genug, um OpenAIs besten Eintrag zu überholen. Nur zwei Modelle liegen über ihm, und beide stammen ebenfalls von Anthropic.
So setzt sich die Bestenliste zusammen
Wenige Tage nach seiner Veröffentlichung kletterte Sonnet 5.5 auf den dritten Platz der Agent Arena. Sein exakter Netto-Verbesserungswert beträgt 12,52 %, mit einer Fehlermarge von plus oder minus 3,09 %.
Die beiden Modelle vor ihm sind Claude Fable 5.1 (Max) mit 14,31 % und Claude Opus 5.5 (High) mit 13,82 %. Direkt dahinter liegt OpenAIs GPT-6 Astra (Max) mit 12,27 %. Damit hält Anthropic drei der vier vorderen Plätze der Liste.
Agent Arena bewertet Modelle anhand von Millionen realer agentischer Aufgaben, bei denen eine KI Werkzeuge nutzen, mehrstufige Aufgaben abschließen und echte Nutzer zufriedenstellen muss. Die Bewertung berücksichtigt Werkzeug-Zuverlässigkeit, Aufgabenerfüllung und Nutzerfeedback. Dieser Fokus spiegelt eine breitere Verschiebung in der Branche wider: Da Einsätze zunehmend darauf angewiesen sind, dass Modelle Werkzeuge aufrufen und mehrstufige Arbeit ausführen, werden Modell-Rankings zunehmend an der durchgängigen Aufgabenausführung gemessen statt allein an statischem Frage-Antworten.
Die Kosten sind die zweite zentrale Kennzahl. Arena beziffert Sonnet 5.5 mit 2,74 $ pro Aufgabe, während Snapshots aus Anfang Oktober die Mediankosten bei rund 2,78 $ pro Aufgabe ansiedeln. Das Modell verbraucht zudem mehr Tokens als die meisten seiner Wettbewerber.
Die Benchmarks jenseits von Arena
Sonnet 5.5s starke Leistung setzt sich bei anderen Benchmarks fort. Auf dem Artificial Analysis Intelligence Index erzielte es 56 Punkte, was Platz zwei hinter Opus 5.5 (Max) bedeutet.
Auf Terminalench 4.0 erreichte Sonnet 5.5 70,6 % – ein deutlicher Sprung gegenüber dem Vorgänger Sonnet 5, der auf demselben Test nur etwa 10 bis 14 % schaffte. Das neue Modell übertraf zudem Opus 5.5, das auf Terminal-Bench 4.0 66,4 % erreichte.
Auch die Geschwindigkeit verbesserte sich: Sonnet 5.5 läuft mehr als 30 % schneller als Sonnet 5. Die Preise blieben jedoch unverändert. Das Modell kostet weiterhin 2 $ pro eine Million Input-Tokens und 10 $ pro eine Million Output-Tokens, wie zuvor. Sonnet 5.5 bietet ein Kontextfenster von einer Million Tokens und eine maximale Ausgabe von 128.000 Tokens. Da die Token-Preise konstant blieben, während gemessene Geschwindigkeit und Werte stiegen, verschiebt das Upgrade die Fähigkeiten-pro-Dollar-Rechnung – wobei der stärkere Token-Hunger des Modells, erkennbar in den Arena-Zahlen, die Variable bleibt, die die realen Kosten pro Aufgabe bestimmt.
Was das für das Rennen der KI-Modelle bedeutet
Das Erste, was man im Auge behalten sollte, ist die Fehlermarge. Sonnet 5.5s Wert weist eine Marge von plus oder minus 3,09 % auf, und die Gesamtspanne zwischen den vier besten Modellen ist kleiner als diese. GPT-6 Astra (Max) liegt nur 0,25 Prozentpunkte hinter Sonnet 5.5. Bei so knappen Abständen kann sich die Reihenfolge ändern, wenn Arena weitere Aufgabenergebnisse zusammenführt; die Rangliste ist daher am besten als aktuelle Momentaufnahme und nicht als gefestigte Hierarchie zu lesen.
Auch der Token-Verbrauch spielt hier eine Rolle. Ein höherer Token-Verbrauch kann den Kostenvorteil je nach Arbeitslast auffressen – ein Modell, das pro Token günstig, aber gesprächig ist, ist nicht immer günstig pro Aufgabe. Für Teams, die Agenten produktiv einsetzen, landen diese beiden Größen – Punktzahl und Kosten pro Aufgabe – am Ende in derselben Tabelle; deshalb wird jede Veröffentlichung, die die Spitze von Listen wie Agent Arena umwälzt, an beiden Dimensionen gemessen.