ActualitésMacroCursor lance Cursor Router : un classificateur au niveau des requêtes offrant une qualité de codage de pointe à un coût inférieur de 30 à 50 %

Cursor lance Cursor Router : un classificateur au niveau des requêtes offrant une qualité de codage de pointe à un coût inférieur de 30 à 50 %

Auteur: MarkTechPost·

Points clés

  • Cursor Router est un classificateur par requête entraîné sur plus de 600 000 requêtes réelles, qui analyse la requête, le contexte, la complexité de la tâche et le domaine afin d’acheminer chaque requête vers le modèle d’IA le plus adapté avant son exécution.
  • Les tests A/B en ligne menés sur des millions de requêtes réelles ont montré des performances de qualité frontier avec environ 60 % d’économies, tandis que trois comptes d’entreprise en accès anticipé ont déclaré des économies de 30 à 50 % par rapport à Opus 4.8.
  • Le routeur tient compte du cache à la fois lors de l’entraînement et de l’évaluation, ce qui signifie que toutes les économies annoncées incluent le coût réel des cache misses qui se produisent lors d’un changement de modèle au milieu d’une conversation, au lieu de les exclure.
  • Grok 4.5 est une option de routage obligatoire et efficace en termes de prix qui ne peut pas être exclue au moyen de listes de blocage de modèles, et les modes Balance et Intelligence sont facturés au tarif variable du modèle sélectionné pour chaque requête routée.
  • Le coût par commit mesuré est de $4.63 pour Auto Balance, $6.76 pour Auto Intelligence, $7.34 pour Opus 4.8 et $12.69 pour Fable 5, fournissant une comparaison des coûts fondée sur les résultats au-delà de la tarification par requête.
Cursor lance Cursor Router : un classificateur au niveau des requêtes offrant une qualité de codage de pointe à un coût inférieur de 30 à 50 %

Cursor a rendu Cursor Router disponible de façon générale pour les offres Teams et Enterprise. Le système est un classificateur au niveau des requêtes qui inspecte chaque requête entrante avant l’exécution de tout modèle, puis l’achemine vers le modèle le mieux adapté à cette tâche précise. Selon l’équipe de Cursor, les tests A/B en ligne démontrent des performances de qualité frontier avec environ 60 % d’économies de coûts, tandis que trois comptes d’entreprise en accès anticipé ont rapporté des économies de 30 à 50 %.

Le problème sous-jacent que Cursor Router cherche à résoudre relève d’un schéma de dépenses, et non d’un manque de capacités. Cursor indique qu’environ 60 % de ses développeurs utilisent un seul modèle comme outil quotidien. En conséquence, les tâches courantes sont exécutées à des prix de niveau frontier, et les dépenses d’IA augmentent plus vite que la qualité des résultats ne s’améliore. Cette tension n’est pas propre à Cursor ; sur le marché des assistants de codage IA — où Cursor est en concurrence avec des produits comme GitHub Copilot, Codeium et Tabnine — les fournisseurs font face au même défi : équilibrer l’accès à plusieurs modèles avec les coûts d’inférence par développeur. Cursor Router est conçu pour résoudre ce décalage.

Fonctionnement du classificateur

Cursor Router n’est ni une chaîne de repli ni un mécanisme de nouvelle tentative. Il s’agit d’un classificateur entraîné sur plus de 600 000 requêtes réelles, évalué au moyen d’un test A/B en ligne couvrant des millions de requêtes réelles, et optimisé pour la satisfaction utilisateur (AFC) comme signal de récompense.

Pour chaque requête, le routeur analyse quatre entrées : la requête, le contexte, la complexité de la tâche et le domaine. Ces éléments sont combinés avec une connaissance apprise du profil comportemental de chaque modèle. Cursor publie trois règles de routage dérivées de cette classification :

  • Les tâches simples sont acheminées vers les modèles les plus efficaces en termes de prix.
  • Les mises à jour d’interface utilisateur sont acheminées vers le modèle doté du meilleur jugement esthétique.
  • Les problèmes complexes et de long terme sont acheminés vers des modèles de raisonnement frontier.

La troisième règle est au cœur de l’argument économique. Les économies ne sont pas obtenues en déclassant les problèmes difficiles ; elles proviennent du retrait des tâches courantes de la tarification de niveau frontier, tandis que le niveau le plus difficile reste inchangé.

Un détail d’implémentation notable : Cursor Router tient compte du cache à la fois lors de l’entraînement et de l’évaluation. Il est entraîné sur un jeu de données dans lequel le routage produit des cache misses, et les économies annoncées incluent le coût de ces cache misses. Changer de modèle au milieu d’une conversation invalide le cache de prompt, et ce coût est réel — les routeurs qui l’ignorent surestiment leurs économies. Le prompt caching, qui permet aux fournisseurs de réutiliser à prix réduit un contexte déjà traité, est devenu une fonctionnalité standard de réduction des coûts proposée par de grands fournisseurs de modèles, notamment Anthropic, OpenAI et Google, ce qui fait de l’invalidation du cache un effet secondaire matériellement coûteux de tout système de changement de modèle.

Le classificateur a également été conçu pour gérer le renouvellement rapide des modèles. Cursor affirme que le routeur peut être mis à jour à mesure que de nouveaux modèles sont publiés, un avantage significatif dans un marché où la frontière se déplace sur une base mensuelle. Avec des fournisseurs comme Anthropic, OpenAI, Google et xAI qui publient chacun des modèles mis à jour selon des calendriers qui se chevauchent, de nouvelles options peuvent apparaître avant même que les équipes aient terminé l’évaluation des options actuelles.

Pourquoi des tests A/B en ligne plutôt que des évaluations hors ligne

Cursor a délibérément évité de faire des évaluations hors ligne sa principale méthode de mesure. L’entreprise explique que les évaluations hors ligne souffrent de tailles d’échantillon limitées, d’un éloignement par rapport aux usages réels et de la difficulté à réduire le succès à une grille standardisée. Elles ne tiennent pas non plus compte du coût de cache miss encouru lors du changement de modèle.

Les décisions de routage réelles se déroulent sur l’ensemble d’une conversation, et non sur un seul échange. Les développeurs écrivent du code, posent des questions de suivi, rencontrent des erreurs et poursuivent — souvent sur des centaines de requêtes au cours d’une semaine donnée. Le routeur doit déterminer à la fois quel modèle sélectionner et quand passer de l’un à l’autre.

Deux métriques de qualité sous-tendent l’évaluation :

  • Satisfaction utilisateur : la réussite de l’agent est classée à partir des réponses des utilisateurs. Passer à la fonctionnalité suivante est traité comme un signal fortement positif ; corriger l’agent est traité comme un signal fortement négatif.
  • Taux de conservation : la proportion de code généré par l’agent qui reste dans la base de code au fil du temps.

L’équipe de Cursor affirme avoir utilisé ces deux métriques pour évaluer chaque lancement de modèle et chaque amélioration du harnais de test au cours des neuf derniers mois. Ces métriques existaient avant le produit qu’elles servent désormais à valider. La métrique de taux de conservation reflète l’accent mis sur une mesure fondée sur les résultats — le fait que le code généré par l’IA persiste ou non — plutôt que sur des taux d’achèvement de tâches qui peuvent ne pas saisir le travail de reprise ou les défaillances en aval.

Trois modes et les chiffres associés

Le mode Auto expose désormais trois paramètres d’optimisation qui déplacent les utilisateurs le long de la frontière de Pareto coût–intelligence :

  • Auto Intelligence se situe près de Fable en matière de satisfaction utilisateur, avec un coût inférieur d’environ 60 % pour les équipes. Face à Opus 4.8, il augmente la satisfaction d’environ 15 % pour un coût presque identique.
  • Auto Balance se situe au-dessus d’Opus 4.8 en matière de satisfaction utilisateur, avec un coût inférieur d’environ 36 %. Face à GPT-5.6 Sol, il fournit une satisfaction comparable à un niveau de dépense plus faible.
  • Cost mode est décrit comme offrant une bonne qualité tout en atteignant la meilleure intelligence disponible et en optimisant la dépense en tokens. Cursor n’a publié aucun chiffre A/B de qualité ou de coût pour ce mode.

Comme le coût par requête ne raconte qu’une partie de l’histoire, Cursor a également mesuré le coût par commit :

Modèle / ModeCoût par commit
Auto Balance$4.63
Auto Intelligence$6.76
Opus 4.8$7.34
Fable 5$12.69

GPT-5.6 Sol a égalé le coût du mode Intelligence, mais a produit une satisfaction utilisateur plus faible. Cursor n’a pas publié de chiffre exact de coût par commit pour ce modèle.

Déploiement et contraintes d’achat

Cursor Router est disponible sur desktop, web, iOS, CLI et le Cursor SDK. Il est activé par défaut pour les offres Teams. Les administrateurs Enterprise peuvent l’activer depuis le tableau de bord.

Le journal des changements précise la surface d’administration : activation par équipe et par groupe, restrictions sur les modes d’optimisation que les membres peuvent sélectionner, mode par défaut configurable, ainsi que listes d’autorisation et de blocage des modèles. Des options d’application souple et stricte existent pour standardiser l’usage du mode Auto. Le modèle routé peut être affiché ou masqué — il est masqué par défaut, de sorte que les équipes qui recherchent la transparence du routage doivent l’activer explicitement.

Deux contraintes sont pertinentes pour la planification des achats :

  1. Grok 4.5 est une option de routage obligatoire et efficace en termes de prix, ce qui signifie que la liste de blocage des modèles ne peut pas être utilisée pour l’exclure. Grok 4.5, publié le 8 juillet, est tarifé à $2/M de tokens en entrée et $6/M de tokens en sortie, avec une variante rapide à $4/M et $18/M.
  2. Les modes Balance et Intelligence sont facturés au tarif du modèle routé, de sorte que le coût unitaire varie à chaque décision de routage au lieu de se stabiliser à un prix fixe par requête.

Faits clés

  • Cursor Router est un classificateur par requête entraîné sur plus de 600 000 requêtes réelles, optimisé pour la satisfaction utilisateur (AFC).
  • Les tests A/B en ligne font état d’une sortie de qualité frontier avec 60 % d’économies ; trois comptes d’entreprise en accès anticipé ont économisé 30 à 50 % par rapport à Opus 4.8.
  • Coût par commit : $4.63 (Balance), $6.76 (Intelligence), contre $7.34 (Opus 4.8) et $12.69 (Fable 5).
  • Les coûts de cache miss liés au changement de modèle sont inclus dans les économies annoncées, et non exclus.
  • Grok 4.5 est une option de routage obligatoire, et Balance et Intelligence sont facturés au tarif du modèle routé.

Sources : article de lancement de Cursor Router, journal des changements de Cursor Router, annonce de Grok 4.5, et @cursor_ai sur X.