Cursor запускает Cursor Router: классификатор на уровне запросов, обеспечивающий качество frontier-моделей для кода при снижении затрат на 30–50%
Ключевые выводы
- •Cursor Router — это классификатор на уровне каждого запроса, обученный более чем на 600,000 реальных запросов; он анализирует запрос, контекст, сложность задачи и предметную область, чтобы до выполнения направить запрос к наиболее подходящей AI-модели.
- •Онлайн A/B-тестирование на миллионах реальных запросов показало качество уровня frontier-моделей при экономии затрат примерно на 60%, а три корпоративных аккаунта раннего доступа сообщили об экономии 30–50% по сравнению с Opus 4.8.
- •Router учитывает кэш как при обучении, так и при оценке, поэтому вся заявленная экономия включает реальную стоимость cache miss, возникающих при переключении моделей в середине диалога, а не исключает ее.
- •Grok 4.5 является обязательным экономически эффективным вариантом маршрутизации, который нельзя исключить через списки заблокированных моделей, а режимы Balance и Intelligence тарифицируются по переменной ставке той модели, которая выбирается для каждого маршрутизированного запроса.
- •Стоимость на commit для измеренных режимов составила $4.63 для Auto Balance, $6.76 для Auto Intelligence, $7.34 для Opus 4.8 и $12.69 для Fable 5, что дает сравнение затрат на основе результата, а не только цены за запрос.

Cursor сделала Cursor Router общедоступным для тарифов Teams и Enterprise. Система представляет собой классификатор на уровне запросов: он проверяет каждый входящий запрос до запуска какой-либо модели, а затем направляет его к модели, наиболее подходящей для конкретной задачи. По данным команды Cursor, онлайн A/B-тесты демонстрируют производительность уровня frontier-моделей при экономии затрат примерно на 60%, тогда как три корпоративных аккаунта раннего доступа сообщили об экономии 30–50%.
Базовая проблема, которую решает Cursor Router, связана с моделью расходов, а не с пробелом в возможностях. Cursor сообщает, что примерно 60% ее разработчиков используют одну модель как основной ежедневный инструмент. В результате рутинные задачи выполняются по ценам frontier-уровня, а расходы на AI растут быстрее, чем улучшается качество результата. Это напряжение характерно не только для Cursor; на рынке AI-ассистентов для программирования — где Cursor конкурирует с такими продуктами, как GitHub Copilot, Codeium и Tabnine, — поставщики сталкиваются с той же задачей: балансировать доступ к нескольким моделям и стоимость инференса на одного разработчика. Cursor Router разработан для устранения этого несоответствия.
Как работает классификатор
Cursor Router не является ни цепочкой fallback, ни механизмом повторных попыток. Это классификатор, обученный более чем на 600,000 реальных запросов, оцененный с помощью онлайн A/B-теста на миллионах реальных запросов и оптимизированный по удовлетворенности пользователей (AFC) как сигналу вознаграждения.
Для каждого запроса router анализирует четыре входных параметра: сам запрос, контекст, сложность задачи и предметную область. Они объединяются с усвоенными знаниями о поведенческом профиле каждой модели. Cursor публикует три правила маршрутизации, выведенные из этой классификации:
- Простая работа направляется к наиболее экономически эффективным моделям.
- Обновления UI направляются к модели с лучшим эстетическим суждением.
- Сложные задачи с длинным горизонтом направляются к frontier-моделям рассуждения.
Третье правило является ключевым для аргумента о снижении затрат. Экономия достигается не за счет понижения качества обработки сложных задач; она возникает благодаря выводу рутинной работы из pricing frontier-уровня при сохранении самого сложного уровня без изменений.
Важная деталь реализации: Cursor Router учитывает кэш как при обучении, так и при оценке. Он обучается на наборе данных, где маршрутизация вызывает cache miss, а заявленная экономия включает стоимость этих cache miss. Переключение моделей в середине диалога инвалидирует prompt cache, и эта стоимость реальна — router-системы, которые ее игнорируют, завышают свою экономию. Prompt caching, позволяющий поставщикам повторно использовать ранее обработанный контекст со скидкой, стал стандартной функцией снижения затрат у крупных поставщиков моделей, включая Anthropic, OpenAI и Google, что делает инвалидацию кэша существенно дорогим побочным эффектом любой системы переключения моделей.
Классификатор также был спроектирован с учетом быстрой сменяемости моделей. Cursor заявляет, что router можно обновлять по мере выхода новых моделей, что является значимым преимуществом на рынке, где frontier-уровень смещается ежемесячно. Поскольку поставщики, включая Anthropic, OpenAI, Google и xAI, выпускают обновленные модели по пересекающимся графикам, новые варианты могут появляться еще до того, как команды завершат оценку текущих.
Почему онлайн A/B-тесты, а не offline evals
Cursor сознательно отказалась от offline-оценок как основного метода измерения. Согласно объяснению компании, offline evals страдают от малых выборок, удаленности от реальных паттернов использования и сложности сведения успеха к стандартизированной рубрике. Кроме того, они не учитывают стоимость cache miss, возникающую при переключении моделей.
Реальные решения о маршрутизации происходят в рамках всего диалога, а не одного шага. Разработчики пишут код, задают уточняющие вопросы, сталкиваются с ошибками и продолжают работу — часто на протяжении сотен запросов за неделю. Router должен определять как то, какую модель выбрать, так и то, когда переключаться между ними.
В основе оценки лежат две метрики качества:
- Удовлетворенность пользователей: успех агента классифицируется по реакциям пользователей. Переход к следующей функции рассматривается как сильный положительный сигнал; исправление агента — как сильный отрицательный.
- Keep rate: доля кода, сгенерированного агентом, которая со временем остается в кодовой базе.
Команда Cursor заявляет, что использовала обе метрики для оценки каждого запуска модели и улучшения harness за последние девять месяцев. Эти метрики существовали до продукта, который теперь с их помощью валидируется. Метрика keep rate отражает акцент на измерении результата — сохраняется ли AI-сгенерированный код — а не на показателях выполнения задач, которые могут не учитывать доработки или последующие сбои.
Три режима и стоящие за ними цифры
Auto mode теперь предлагает три настройки оптимизации, которые перемещают пользователей по Парето-фронту «стоимость–интеллект»:
- Auto Intelligence оказывается близко к Fable по удовлетворенности пользователей при примерно на 60% более низкой стоимости для команд. По сравнению с Opus 4.8 он повышает удовлетворенность примерно на 15% почти при той же стоимости.
- Auto Balance оказывается выше Opus 4.8 по удовлетворенности пользователей при примерно на 36% более низкой стоимости. По сравнению с GPT-5.6 Sol он обеспечивает сопоставимую удовлетворенность при более низком темпе расходов.
- Cost mode описывается как режим, достигающий хорошего качества при использовании максимального доступного интеллекта и оптимизации расходов на токены. Cursor не публиковала A/B-показатели качества или стоимости для этого режима.
Поскольку стоимость одного запроса отражает только часть картины, Cursor также измерила стоимость на commit:
| Модель / режим | Стоимость на commit |
|---|---|
| Auto Balance | $4.63 |
| Auto Intelligence | $6.76 |
| Opus 4.8 | $7.34 |
| Fable 5 | $12.69 |
GPT-5.6 Sol совпал по стоимости с режимом Intelligence, но показал более низкую удовлетворенность пользователей. Cursor не опубликовала для него точный показатель стоимости на commit.
Развертывание и ограничения для закупок
Cursor Router доступен на desktop, web, iOS, CLI и в Cursor SDK. Для тарифов Teams он включен по умолчанию. Администраторы Enterprise могут активировать его из dashboard.
Changelog описывает административные возможности: включение по командам и группам, ограничения на выбор доступных участникам режимов оптимизации, настраиваемый режим по умолчанию, а также списки разрешенных и заблокированных моделей. Для стандартизации на Auto mode доступны мягкие и жесткие варианты принудительного применения. Маршрутизированная модель может отображаться или скрываться — по умолчанию она скрыта, поэтому командам, которым нужна прозрачность маршрутизации, необходимо явно включить эту опцию.
Для планирования закупок важны два ограничения:
- Grok 4.5 является обязательным экономически эффективным вариантом маршрутизации, поэтому список заблокированных моделей нельзя использовать для его исключения. Grok 4.5, выпущенный July 8, стоит $2/M за входные токены и $6/M за выходные токены, а fast-вариант — $4/M и $18/M.
- Режимы Balance и Intelligence тарифицируются по ставке маршрутизированной модели, поэтому удельная стоимость меняется при каждом решении о маршрутизации, а не фиксируется как плоская цена за запрос.
Ключевые факты
- Cursor Router — это классификатор на уровне каждого запроса, обученный на 600,000+ реальных запросов и оптимизированный по удовлетворенности пользователей (AFC).
- Онлайн A/B-тесты показывают результат уровня frontier-моделей при экономии 60%; три корпоративных аккаунта раннего доступа сэкономили 30–50% по сравнению с Opus 4.8.
- Стоимость на commit: $4.63 (Balance), $6.76 (Intelligence) против $7.34 (Opus 4.8) и $12.69 (Fable 5).
- Стоимость cache miss при переключении моделей включена в заявленную экономию, а не исключена из нее.
- Grok 4.5 является обязательным вариантом маршрутизации, а Balance и Intelligence тарифицируются по ставке маршрутизированной модели.
Источники: публикация о запуске Cursor Router, changelog Cursor Router, анонс Grok 4.5 и @cursor_ai в X.