NieuwsMacroClaude Sonnet 5.5 neemt derde plaats in op Arena's Agent Arena-ranglijst

Claude Sonnet 5.5 neemt derde plaats in op Arena's Agent Arena-ranglijst

Auteur: CryptoBriefing·

Belangrijkste punten

  • •Claude Sonnet 5.5 binnenkwam op Arena.ai's Agent Arena als derde met een nettoverbeteringsscore van 12,52%, achter twee andere Anthropic-modellen: Claude Fable 5.1 (Max) met 14,31% en Claude Opus 5.5 (High) met 13,82%.
  • •Het model verslo nipt OpenAI's GPT-6 Astra (Max), dat vierde staat met 12,27%, maar het verschil van 0,25 punt is kleiner dan de foutmarge van Sonnet 5.5 van plus of min 3,09%, dus de stand kan nog wijzigen.
  • •Op Terminal-Bench 4.0 scoorde Sonnet 5.5 70,6%, een flinke stijging ten opzichte van de ruwweg 10-14% die voorganger Sonnet 5 behaalde, en het overtrof ook de 66,4% van Opus 5.5.
  • •Sonnet 5.5 draait meer dan 30% sneller dan Sonnet 5 met dezelfde prijzen van $2 per miljoen inputtokens en $10 per miljoen outputtokens, met een contextvenster van 1 miljoen tokens.
  • •Arena vermeldt de kosten van Sonnet 5.5 op $2,74 per taak, en het hogere tokenverbruik dan de meeste concurrenten kan de werkelijke kosten per taak bij productie-inzet bepalen.
Claude Sonnet 5.5 neemt derde plaats in op Arena's Agent Arena-ranglijst

Anthropic's nieuwste middensegmentmodel heeft de derde plaats veroverd op de Agent Arena-ranglijst van Arena.ai. Claude Sonnet 5.5, dat op 28 september 2026 werd uitgebracht, behaalde een nettoverbeteringsscore van 12,5% — genoeg om OpenAI's beste inzending voorbij te streven. Slechts twee modellen staan erboven, en beide zijn eveneens van Anthropic.

Hoe de ranglijst eruitziet

Binnen enkele dagen na de release klom Sonnet 5.5 naar de derde plaats op Agent Arena. De exacte nettoverbeteringsscore is 12,52%, met een foutmarge van plus of min 3,09%.

De twee modellen erboven zijn Claude Fable 5.1 (Max) met 14,31% en Claude Opus 5.5 (High) met 13,82%. Direct eronder staat OpenAI's GPT-6 Astra (Max) met 12,27%. Met deze resultaten houdt Anthropic drie van de topvier posities op de ranglijst in handen.

Agent Arena beoordeelt modellen op miljoenen echte agentische taken, waarbij een AI tools moet gebruiken, meerstaps-opdrachten moet voltooien en daadwerkelijke gebruikers tevreden moet stellen. De score omvat de betrouwbaarheid van tools, taakvoltooiing en gebruikersfeedback. Die nadruk weerspiegelt een bredere verschuiving in de sector: inzetten steeds meer leunen op modellen die tools aanroepen en meerstapswerk uitvoeren, wordt de strijd om modelrangschikkingen steeds vaker beslecht op end-to-end taakuitvoering in plaats van uitsluitend statisch vraag-en-antwoord.

Kosten zijn het andere kopnummer. Arena vermeldt Sonnet 5.5 op $2,74 per taak, terwijl snapshots uit begin oktober de mediane kosten op ongeveer $2,78 per taak leggen. Het model verbruikt ook meer tokens dan de meeste concurrenten.

De benchmarks voorbij Arena

De sterke prestatie van Sonnet 5.5 strekt zich ook uit tot andere benchmarks. Op de Artificial Analysis Intelligence Index scoorde het 56, goed voor de tweede plaats achter Opus 5.5 (Max).

Op Terminal-Bench 4.0 scoorde Sonnet 5.5 70,6% — een flinke sprong ten opzichte van de voorganger Sonnet 5, die op dezelfde test ruwweg 10 tot 14% behaalde. Het nieuwe model ging ook voorbij aan Opus 5.5, dat 66,4% scoorde op Terminal-Bench 4.0.

De snelheid verbeterde eveneens: Sonnet 5.5 draait meer dan 30% sneller dan Sonnet 5. De prijzen veranderden echter niet. Het model kost nog steeds $2 per miljoen inputtokens en $10 per miljoen outputtokens, hetzelfde als voorheen. Sonnet 5.5 biedt een contextvenster van 1 miljoen tokens en een maximale output van 128.000 tokens. Nu de prijzen per token gelijk bleven terwijl de gemeten snelheid en scores stegen, verschuift de upgrade de verhouding tussen capaciteit en dollar — al blijft het hogere tokenverbruik van het model, zichtbaar in de Arena-cijfers, de variabele die de werkelijke kosten per taak bepaalt.

Wat dit betekent voor de AI-modelrace

Het eerste om op te letten is de foutmarge. De score van Sonnet 5.5 heeft een marge van plus of min 3,09%, en de totale afstand tussen de topvier modellen is kleiner dan dat. GPT-6 Astra (Max) volgt Sonnet 5.5 op slechts 0,25 procentpunt. Bij zulke kleine verschillen kan de volgorde veranderen naarmate Arena meer taakresultaten verzamelt, dus de stand is het best te lezen als een actuele snapshot in plaats van een vastgestelde hiërarchie.

Tokenverbruik speelt hier ook een rol. Hoger tokengebruik kan het kostenvoordeel aantasten, afhankelijk van de werklast — een model dat goedkoop per token is maar veel woorden gebruikt, is niet per se goedkoop per taak. Voor teams die agents in productie draaien, komen die twee kolommen — score en kosten per taak — op hetzelfde rekenblad terecht, en daarom wordt elke release die de top van ranglijsten zoals Agent Arena doorschudt, op beide dimensies gewogen.