NieuwsMacroCursor lanceert Cursor Router: een classifier op verzoekniveau die frontier-codeerkwaliteit levert tegen 30–50% lagere kosten

Cursor lanceert Cursor Router: een classifier op verzoekniveau die frontier-codeerkwaliteit levert tegen 30–50% lagere kosten

Auteur: MarkTechPost·

Belangrijkste punten

  • Cursor Router is een classifier per verzoek, getraind op meer dan 600.000 live-verzoeken, die query, context, taakcomplexiteit en domein analyseert om elk verzoek vóór uitvoering naar het meest geschikte AI-model te routeren.
  • Online A/B-tests over miljoenen live-verzoeken toonden prestaties van frontier-kwaliteit aan met ongeveer 60% kostenbesparing, terwijl drie enterprise-accounts met vroege toegang besparingen van 30 tot 50 procent rapporteerden vergeleken met Opus 4.8.
  • De router houdt bij zowel training als evaluatie rekening met caching, wat betekent dat alle gerapporteerde besparingen de werkelijke kosten omvatten van cache misses die optreden wanneer midden in een gesprek van model wordt gewisseld.
  • Grok 4.5 is een verplichte prijsefficiënte routeringsoptie die niet via blokkeerlijsten voor modellen kan worden uitgesloten, en Balance- en Intelligence-modi worden gefactureerd tegen het variabele tarief van het model dat voor elk gerouteerd verzoek wordt geselecteerd.
  • De gemeten kosten per commit bedragen $4.63 voor Auto Balance, $6.76 voor Auto Intelligence, $7.34 voor Opus 4.8 en $12.69 voor Fable 5, wat een uitkomstgerichte kostenvergelijking biedt naast prijzen per verzoek.
Cursor lanceert Cursor Router: een classifier op verzoekniveau die frontier-codeerkwaliteit levert tegen 30–50% lagere kosten

Cursor heeft Cursor Router algemeen beschikbaar gemaakt voor Teams- en Enterprise-abonnementen. Het systeem is een classifier op verzoekniveau die elk binnenkomend verzoek inspecteert voordat een model wordt uitgevoerd, en het vervolgens doorstuurt naar het model dat het best geschikt is voor die specifieke taak. Volgens het Cursor-team tonen online A/B-tests prestaties van frontier-kwaliteit aan met ongeveer 60% kostenbesparing, terwijl drie enterprise-accounts met vroege toegang besparingen van 30–50% rapporteerden.

Het onderliggende probleem dat Cursor Router aanpakt, is een uitgavenpatroon, geen tekort aan capaciteiten. Cursor meldt dat ongeveer 60% van zijn ontwikkelaars één model als dagelijkse standaard gebruikt. Daardoor worden routinetaken uitgevoerd tegen prijzen op frontier-niveau, en stijgen AI-uitgaven sneller dan de outputkwaliteit verbetert. Deze spanning is niet uniek voor Cursor; in de markt voor AI-codeerassistenten — waar Cursor concurreert met producten zoals GitHub Copilot, Codeium en Tabnine — staan aanbieders voor dezelfde uitdaging om multi-modeltoegang in balans te brengen met inferentiekosten per ontwikkelaar. Cursor Router is ontworpen om die mismatch op te lossen.

Hoe de classifier werkt

Cursor Router is geen fallback-keten en ook geen retry-mechanisme. Het is een classifier die is getraind op meer dan 600.000 live-verzoeken, geëvalueerd via een online A/B-test over miljoenen live-verzoeken, en geoptimaliseerd voor gebruikerstevredenheid (AFC) als beloningssignaal.

Voor elk verzoek analyseert de router vier inputs: query, context, taakcomplexiteit en domein. Deze worden gecombineerd met aangeleerde kennis van het gedragsprofiel van elk model. Cursor publiceert drie routeringsregels die uit deze classificatie zijn afgeleid:

  • Eenvoudig werk wordt gerouteerd naar de meest prijsefficiënte modellen.
  • UI-updates worden gerouteerd naar het model met het beste esthetische oordeel.
  • Complexe problemen met een lange tijdshorizon worden gerouteerd naar frontier-redeneermodellen.

De derde regel staat centraal in het kostenargument. Besparingen worden niet bereikt door moeilijke problemen af te waarderen; ze ontstaan doordat routinematig werk wordt weggehaald uit prijsniveaus voor frontier-modellen, terwijl de moeilijkste categorie onaangetast blijft.

Een opvallend implementatiedetail: Cursor Router houdt zowel bij training als evaluatie rekening met cachegedrag. Het is getraind op een dataset waarin routering cache misses veroorzaakt, en de gerapporteerde besparingen omvatten de kosten van die cache misses. Van model wisselen midden in een gesprek maakt de promptcache ongeldig, en die kosten zijn reëel — routers die dit negeren, overschatten hun besparingen. Prompt caching, waarmee aanbieders eerder verwerkte context met korting kunnen hergebruiken, is een standaardfunctie voor kostenreductie geworden bij grote modelaanbieders, waaronder Anthropic, OpenAI en Google. Daardoor is cache-invalidatie een materieel dure bijwerking van elk systeem dat tussen modellen wisselt.

De classifier is ook ontworpen om snelle modelvernieuwing op te vangen. Cursor stelt dat de router kan worden bijgewerkt wanneer nieuwere modellen verschijnen, een betekenisvol voordeel in een markt waarin de frontier maandelijks verschuift. Doordat aanbieders zoals Anthropic, OpenAI, Google en xAI elk op overlappende tijdlijnen bijgewerkte modellen uitbrengen, kunnen nieuwe opties verschijnen voordat teams klaar zijn met het evalueren van de huidige.

Waarom online A/B-tests in plaats van offline evaluaties

Cursor heeft er bewust voor gekozen offline evaluaties niet als primaire meetmethode te gebruiken. Het bedrijf geeft als reden dat offline evals kampen met kleine steekproeven, afstand tot werkelijke gebruikspatronen en de moeilijkheid om succes terug te brengen tot een gestandaardiseerde rubric. Ze houden bovendien geen rekening met de cache-misskosten die ontstaan wanneer van model wordt gewisseld.

Echte routeringsbeslissingen vinden plaats over een volledig gesprek, niet binnen één enkele beurt. Ontwikkelaars schrijven code, stellen vervolgvragen, lopen tegen fouten aan en gaan verder — vaak over honderden verzoeken in een bepaalde week. De router moet bepalen welk model moet worden geselecteerd én wanneer er tussen modellen moet worden gewisseld.

Twee kwaliteitsstatistieken vormen de basis van de evaluatie:

  • Gebruikerstevredenheid: Het succes van de agent wordt geclassificeerd op basis van gebruikersreacties. Doorgaan naar de volgende feature wordt behandeld als een sterk positief signaal; de agent corrigeren als een sterk negatief signaal.
  • Keep rate: Het aandeel door de agent gegenereerde code dat in de loop van de tijd in de codebase blijft staan.

Het Cursor-team stelt dat het beide statistieken de afgelopen negen maanden heeft gebruikt om elke modellancering en elke verbetering van de harness te evalueren. Deze statistieken bestonden dus al vóór het product dat er nu mee wordt gevalideerd. De keep rate-statistiek weerspiegelt een nadruk op uitkomstgerichte meting — of door AI gegenereerde code blijft bestaan — in plaats van taakvoltooiingspercentages die herwerk of downstream-fouten mogelijk niet vastleggen.

Drie modi en de cijfers erachter

Auto-modus biedt nu drie optimalisatie-instellingen die gebruikers langs de Pareto-frontier van kosten en intelligentie bewegen:

  • Auto Intelligence komt qua gebruikerstevredenheid dicht bij Fable uit, tegen ongeveer 60% lagere kosten voor teams. Ten opzichte van Opus 4.8 verhoogt het de tevredenheid met ongeveer 15% tegen vrijwel dezelfde kosten.
  • Auto Balance komt qua gebruikerstevredenheid boven Opus 4.8 uit tegen ongeveer 36% lagere kosten. Ten opzichte van GPT-5.6 Sol levert het vergelijkbare tevredenheid tegen een lager uitgavenniveau.
  • Cost mode wordt omschreven als een modus die goede kwaliteit behaalt, de hoogst beschikbare intelligentie bereikt en tegelijkertijd tokenuitgaven optimaliseert. Cursor publiceerde voor deze modus geen A/B-cijfers over kwaliteit of kosten.

Omdat kosten per verzoek slechts een deel van het beeld geven, heeft Cursor ook kosten per commit gemeten:

Model / modusKosten per commit
Auto Balance$4.63
Auto Intelligence$6.76
Opus 4.8$7.34
Fable 5$12.69

GPT-5.6 Sol evenaarde de kosten van Intelligence mode, maar leverde lagere gebruikerstevredenheid op. Cursor publiceerde hiervoor geen exact bedrag per commit.

Implementatie en inkoopbeperkingen

Cursor Router is beschikbaar op desktop, web, iOS, CLI en de Cursor SDK. Het staat standaard ingeschakeld voor Teams-abonnementen. Enterprise-beheerders kunnen het activeren via het dashboard.

De changelog specificeert de beheerdersmogelijkheden: inschakeling per team en per groep, beperkingen op welke optimalisatiemodi leden kunnen selecteren, een configureerbare standaardmodus en lijsten om modellen toe te staan of te blokkeren. Er zijn zowel zachte als harde handhavingsopties om standaardisatie op Auto mode mogelijk te maken. Het gerouteerde model kan worden weergegeven of verborgen — standaard is het verborgen, dus teams die transparantie over routering willen, moeten daar expliciet voor kiezen.

Twee beperkingen zijn relevant voor inkoopplanning:

  1. Grok 4.5 is een vereiste prijsefficiënte routeringsoptie, wat betekent dat de blokkeerlijst voor modellen niet kan worden gebruikt om het uit te sluiten. Grok 4.5, uitgebracht op July 8, kost $2/M inputtokens en $6/M outputtokens, met een snelle variant van $4/M en $18/M.
  2. Balance- en Intelligence-modi worden gefactureerd tegen het tarief van het gerouteerde model, waardoor de eenheidskosten per routeringsbeslissing variëren in plaats van uit te komen op een vaste prijs per verzoek.

Kernpunten

  • Cursor Router is een classifier per verzoek, getraind op meer dan 600.000 live-verzoeken en geoptimaliseerd voor gebruikerstevredenheid (AFC).
  • Online A/B-tests melden output van frontier-kwaliteit tegen 60% besparing; drie enterprise-accounts met vroege toegang bespaarden 30–50% ten opzichte van Opus 4.8.
  • Kosten per commit: $4.63 (Balance), $6.76 (Intelligence), tegenover $7.34 (Opus 4.8) en $12.69 (Fable 5).
  • Cache-misskosten door het wisselen van modellen zijn inbegrepen in de gerapporteerde besparingen, niet uitgesloten.
  • Grok 4.5 is een verplichte routeringsoptie, en Balance en Intelligence worden gefactureerd tegen het tarief van het gerouteerde model.

Bronnen: lanceringspost van Cursor Router, changelog van Cursor Router, aankondiging van Grok 4.5 en @cursor_ai op X.