NachrichtenMakroAnthropics Claude Opus 5 übertrifft Fable 5 in den meisten Benchmarks zum halben Preis

Anthropics Claude Opus 5 übertrifft Fable 5 in den meisten Benchmarks zum halben Preis

Autor: Decrypt·

Wichtige Erkenntnisse

  • Claude Opus 5 startete am 24. Juli zu $5 pro Million Eingabe-Token, genau halb so teuer wie Fable 5, und übertrifft es zugleich in nahezu jedem wichtigen Benchmark.
  • Opus 5 ist nun das Standardmodell bei Claude Max und die stärkste Option bei Claude Pro. Damit ersetzt es Fable 5 faktisch als Anthropics Abonnenten-Flaggschiff, nachdem dieses Modell mit Exportkontrollproblemen und Beschränkungen auf ein reines Credits-Modell konfrontiert war.
  • Bei Frontier-Bench v0.1 erzielte Opus 5 43.3% und übertraf damit Fable 5 mit 33.7% sowie OpenAIs GPT-5.6 Sol mit 34.4% bei Ende-zu-Ende-Aufgaben in der Softwareentwicklung.
  • Lovable meldete eine Verbesserung von 22% gegenüber Opus 4.7 bei agentischen Coding-Aufgaben, während Zapier für Opus 5 eine perfekte AutomationBench-Wertung bei einem vollständigen Workflow zur Churn-Prävention verzeichnete.
  • Die Veröffentlichung erfolgte eine Woche, nachdem das in Beijing ansässige Unternehmen Moonshot AI Kimi K3 vorgestellt hatte, ein Open-Weight-Modell mit 2.8 Billionen Parametern, das unabhängige Benchmarks insgesamt auf Rang drei hinter Fable 5 und GPT-5.6 Sol einstufen.
Anthropics Claude Opus 5 übertrifft Fable 5 in den meisten Benchmarks zum halben Preis

Anthropic hat Claude Opus 5 am 24. Juli veröffentlicht, mit einem Preis von $5 pro Million Eingabe-Token—identisch mit dem Vorgänger Opus 4.8 und genau halb so teuer wie Fable 5—während es Fable 5 in den meisten wichtigen Benchmarks übertrifft. Das neue Modell ist nun Standard bei Claude Max und die leistungsstärkste Option bei Claude Pro, womit es Fable 5 faktisch als erste Wahl für die meisten Abonnenten ersetzt.

Opus 5 ist für Unternehmen im Betrieb günstiger als Anthropics führendes Modell Claude Fable 5, das das Unternehmen als alltägliches Frontier-Produkt für zahlende Nutzer positioniert hatte. Zudem schneidet es in mehreren wichtigen Benchmarks besser ab als Fable 5. Für Unternehmen, die Produkte auf Basis von KI-APIs entwickeln, bei denen Token-Kosten direkt mit dem Nutzungsvolumen skalieren, kann ein Modell, das Frontier-Leistung zum halben Preis erreicht oder übertrifft, die Stückkosten spürbar verändern.

Anthropics Modell-Tier-Struktur

Anthropics Angebot umfasst vier Tiers. Haiku ist schnell und günstig. Sonnet liegt im Mittelfeld. Opus dient als leistungsstarkes Arbeitspferd. Darüber steht die Mythos-Klasse, ein Tier, das Anthropic in diesem Frühjahr eingeführt hat. Dazu gehören Claude Fable 5 für die Öffentlichkeit sowie Claude Mythos 5, eine Version mit weniger Einschränkungen, die über Project Glasswing geprüften Cybersicherheitsforschern und Betreibern kritischer Infrastruktur zur Verfügung steht.

Fable 5 hatte einen turbulenten Lauf als Abonnenten-Flaggschiff. Es startete am 9. Juni, wurde jedoch drei Tage später weltweit zurückgezogen, nachdem die US-Regierung unter Verweis auf eine Jailbreak-Schwachstelle eine Notfall-Exportkontrollanordnung erlassen hatte. Am 30. Juni kehrte es zurück, wechselte aber umgehend zu einem reinen Credits-Modell und ist nicht mehr in Standardplänen enthalten. Opus 5 füllt nun die Lücke, die Fable 5 nicht halten konnte.

Lovable, eine Entwicklerplattform mit Millionen von Nutzern, testete Opus 5 in internen Bewertungen und stellte fest, dass die Verbesserungen über reine Punktzahlen hinausgehen. "It isn't just better on our hardest agentic coding tasks, up 22% over Opus 4.7, it's steadier, with far less variance run to run," sagte Fabian Hedin in einer von Anthropic geteilten Stellungnahme.

Benchmark-Ergebnisse

Opus 5 schlägt Fable 5 bei nahezu jeder Kennzahl, die für Alltagsnutzer relevant ist, obwohl es nicht als Mythos-Klasse eingestuft ist.

Bei Frontier-Bench v0.1—einem Benchmark, der testet, ob KI-Coding-Agenten reale Softwareentwicklungsaufgaben Ende-zu-Ende abschließen können, bewertet als Prozentsatz bestandener Aufgaben—erreichte Opus 5 43.3%. Fable 5 kam auf 33.7%, während OpenAIs GPT-5.6 Sol, Anthropics wichtigster kommerzieller Wettbewerber, 34.4% erzielte.

Der größte Abstand zeigte sich bei ARC-AGI-3, einem Test für echtes Problemlösen anhand neuartiger Rätsel, die ein Modell nicht aus Trainingsdaten auswendig gelernt haben konnte, bewertet als Prozentsatz gelöster Rätsel. Opus 5 erreichte 30.2%; GPT-5.6 Sol kam auf 7.8%; und Fable 5 wurde überhaupt nicht getestet.

Bei GDPval-AA v2—einem Benchmark für Wissensarbeit, der über Elo-Wertungen bewertet wird, das aus dem Schach bekannte Rangsystem zur Messung relativer Leistung bei realen beruflichen Aufgaben—erreichte Opus 5 1,861, verglichen mit 1,747 bei Fable 5 und 1,736 bei GPT-5.6 Sol.

Zapier testete Opus 5 auf AutomationBench, einer Bewertung, die misst, ob ein Modell einen vollständigen Geschäftsworkflow von Anfang bis Ende ohne menschliches Eingreifen ausführen kann. Das Urteil: Das Modell "took a raw account-health workbook and ran a full churn-prevention sequence end to end: flagging at-risk accounts, alerting the right owner, and summarizing for retention ops. Previous models didn't pass; Opus 5 hit 100%."

Anthropic positioniert Opus 5 zudem als Upgrade für Forschung. Ultima Genomics, ein Unternehmen für DNA-Sequenzierung, sagte, das Modell "behaves more like a careful scientist than any model we've run. It reaches for the right statistical tests to rule out confounders, cross-checks its own results by independent methods, and stays on track through long multi-step analyses."

Allerdings sind Recht und Gesundheit die einzigen beiden Bereiche, in denen Fable 5 mit knappem Vorsprung besser abschneidet.

Breiteres Wettbewerbsumfeld

Die Veröffentlichung erfolgt eine Woche, nachdem Moonshot AI, ein von Alibaba unterstütztes Startup mit Sitz in Beijing, Kimi K3 vorgestellt hat—ein Open-Weight-Modell mit 2.8 Billionen Parametern, was bedeutet, dass jeder den zugrunde liegenden Code herunterladen und unabhängig ausführen kann. Moonshot beschreibt es als das weltweit größte offene KI-System. Unabhängige Benchmarks platzieren Kimi K3 durchweg auf Rang drei insgesamt, hinter Fable 5 und GPT-5.6 Sol, auch wenn es diese beiden in bestimmten Bereichen übertrifft. Dieser Open-Weight-Ansatz, der im Gegensatz zum API-only-Zugangsmodell von Anthropic und OpenAI steht, ermöglicht es Organisationen, Modelle auf eigener Hardware zu betreiben—wobei ein System mit 2.8 Billionen Parametern erhebliche Rechenressourcen für den Betrieb erfordert.

Preise und Verfügbarkeit

Opus 5 ist ab sofort per API zu $5 pro Million Eingabe-Token und $25 pro Million Ausgabe-Token verfügbar. (Token sind die grundlegende Informationseinheit, die ein KI-Modell sowohl bei Eingabe als auch Ausgabe verarbeitet.) Ein Fast-Modus mit etwa 2.5-facher Standardgeschwindigkeit ist ebenfalls verfügbar, zum Doppelten des Basispreises—$10 pro Million Eingabe-Token und $50 pro Million Ausgabe.

Die Veröffentlichung könnte anhaltende Sorgen über die eingeschränkte öffentliche Verfügbarkeit von Fable 5 abmildern. Opus 5 ist außerdem für alle Nutzer per Abonnement zugänglich.