新闻宏观经济Cursor 推出 Cursor Router:请求级分类器以低 30–50% 的成本提供前沿级编码质量

Cursor 推出 Cursor Router:请求级分类器以低 30–50% 的成本提供前沿级编码质量

作者: MarkTechPost·

要点速览

  • Cursor Router 是一个按请求运行的分类器,基于超过 600,000 个真实请求训练,会分析查询、上下文、任务复杂度和领域,并在执行前将每个请求路由到最合适的 AI 模型。
  • 覆盖数百万个真实请求的在线 A/B 测试显示,其能够以约 60% 的成本节省实现前沿级性能;三个早期访问企业账户报告称,相比 Opus 4.8 节省了 30% 至 50% 的成本。
  • 该路由器在训练和评估中都具备缓存感知能力,这意味着所有报告的节省都包含对话中途切换模型时发生的真实缓存未命中成本,而不是将其排除在外。
  • Grok 4.5 是强制性的高价格效率路由选项,无法通过模型阻止列表排除;Balance 和 Intelligence 模式则按每次路由请求所选模型的可变费率计费。
  • 三种模式的每次提交成本分别为 Auto Balance $4.63、Auto Intelligence $6.76、Opus 4.8 $7.34 和 Fable 5 $12.69,为超越每请求定价的结果导向成本比较提供了依据。
Cursor 推出 Cursor Router:请求级分类器以低 30–50% 的成本提供前沿级编码质量

Cursor 已面向 Teams 和 Enterprise 方案全面开放 Cursor Router。该系统是一种请求级分类器,会在任何模型执行之前检查每个传入请求,然后将其分发给最适合该特定任务的模型。根据 Cursor 团队的说法,在线 A/B 测试显示,其能够以约 60% 的成本节省实现前沿级性能,而三个早期访问企业账户报告节省了 30–50% 的成本。

Cursor Router 试图解决的根本问题是一种支出模式,而不是能力缺口。Cursor 报告称,约 60% 的开发者会使用单一模型作为日常主力。因此,常规任务也会以前沿级价格完成,AI 支出的增长速度超过输出质量的改善速度。这种张力并非 Cursor 独有;在 AI 编程助手市场中,Cursor 与 GitHub Copilot、Codeium 和 Tabnine 等产品竞争,供应商都面临同样的挑战:如何在多模型访问与每位开发者的推理成本之间取得平衡。Cursor Router 旨在解决这种错配。

分类器如何工作

Cursor Router 既不是备用链,也不是重试机制。它是一个基于超过 600,000 个真实请求训练的分类器,通过覆盖数百万个真实请求的在线 A/B 测试进行评估,并以用户满意度(AFC)作为奖励信号进行优化。

对于每个请求,路由器会分析四项输入:查询、上下文、任务复杂度和领域。这些输入会与系统对每个模型行为特征的学习结果相结合。Cursor 发布了三条由该分类得出的路由规则:

  • 简单工作会被路由到价格效率最高的模型。
  • UI 更新会被路由到审美判断最好的模型。
  • 复杂、长周期问题会被路由到前沿推理模型。

第三条规则是成本论点的核心。节省并不是通过降低困难问题的模型级别实现的;它来自于将常规工作从前沿级定价中移出,同时保持最困难任务层级不受影响。

一个值得注意的实现细节是:Cursor Router 在训练和评估中都具备缓存感知能力。它使用的数据集包含路由产生缓存未命中的情况,且报告的成本节省已包含这些缓存未命中的成本。在对话中途切换模型会使提示缓存失效,这一成本是真实存在的——忽略这一点的路由器会夸大其节省效果。提示缓存允许供应商以折扣方式复用此前处理过的上下文,已成为 Anthropic、OpenAI 和 Google 等主要模型提供商提供的标准降本功能,因此缓存失效会成为任何模型切换系统中具有实质成本影响的副作用。

该分类器还被设计为能够适应快速的模型更替。Cursor 表示,随着新模型发布,路由器可以进行更新。在一个前沿能力几乎按月变化的市场中,这是一项有意义的优势。Anthropic、OpenAI、Google 和 xAI 等供应商都在交叠的时间线上发布更新模型,新选项可能在团队完成当前模型评估之前就已出现。

为什么采用在线 A/B 测试而不是离线评测

Cursor 有意避免将离线评估作为主要衡量方法。该公司给出的理由是,离线评测存在样本量小、与真实使用模式距离较远,以及难以将成功压缩为标准化评分规则等问题。它们也无法计入切换模型时产生的缓存未命中成本。

真实的路由决策发生在完整对话过程中,而不是单一轮次中。开发者会编写代码、提出后续问题、遇到错误并继续推进——在某一周内往往会跨越数百个请求。路由器必须判断选择哪个模型,以及何时在模型之间切换。

评估由两项质量指标支撑:

  • 用户满意度:根据用户响应对智能体成功情况进行分类。继续进入下一个功能被视为强正向信号;纠正智能体则被视为强负向信号。
  • 保留率:智能体生成的代码随时间推移在代码库中保留下来的比例。

Cursor 团队表示,在过去九个月中,它一直使用这两项指标来评估每次模型发布和工具链改进。这些指标早于当前用来验证的产品本身。保留率指标体现了对基于结果衡量的重视——即 AI 生成的代码是否持续存在——而不是可能无法反映返工或下游失败的任务完成率。

三种模式及其背后的数据

Auto 模式现在提供三种优化设置,使用户可以沿着成本—智能的帕累托前沿进行选择:

  • Auto Intelligence 在用户满意度上接近 Fable,同时为团队带来约 60% 的成本降低。与 Opus 4.8 相比,它在成本几乎相同的情况下将满意度提高约 15%。
  • Auto Balance 在用户满意度上高于 Opus 4.8,同时成本降低约 36%。与 GPT-5.6 Sol 相比,它以更低的支出率提供相当的满意度。
  • Cost mode 被描述为在优化 token 支出的同时,实现良好质量并达到可用的最高智能水平。Cursor 未公布该模式的 A/B 质量或成本数据。

由于每次请求成本只能反映部分情况,Cursor 还衡量了每次提交成本:

模型 / 模式每次提交成本
Auto Balance$4.63
Auto Intelligence$6.76
Opus 4.8$7.34
Fable 5$12.69

GPT-5.6 Sol 的成本与 Intelligence 模式相当,但用户满意度更低。Cursor 未公布其确切的每次提交成本数据。

部署与采购约束

Cursor Router 可在桌面端、网页端、iOS、CLI 和 Cursor SDK 中使用。它在 Teams 方案中默认启用。Enterprise 管理员可以从仪表盘中启用该功能。

更新日志说明了管理界面能力:可按团队和按小组启用,可限制成员能够选择的优化模式,可配置默认模式,以及模型允许列表和阻止列表。对于在 Auto 模式上标准化,还提供软性和硬性执行选项。被路由到的模型可以显示或隐藏——默认情况下为隐藏,因此希望获得路由透明度的团队必须明确选择启用。

有两项约束与采购规划相关:

  1. Grok 4.5 是必需的高价格效率路由选项,这意味着无法通过模型阻止列表将其排除。Grok 4.5 于 July 8 发布,价格为输入 token $2/M、输出 token $6/M,其快速变体价格为 $4/M 和 $18/M。
  2. Balance 和 Intelligence 模式按被路由模型的费率计费,因此单位成本会随每次路由决策而变化,而不是固定为统一的每请求价格。

关键事实

  • Cursor Router 是一个按请求运行的分类器,基于 600,000+ 个真实请求训练,并针对用户满意度(AFC)进行优化。
  • 在线 A/B 测试显示,其以 60% 的成本节省实现前沿级输出;三个早期访问企业账户相较 Opus 4.8 节省了 30–50%。
  • 每次提交成本:$4.63(Balance)、$6.76(Intelligence),相比之下 Opus 4.8 为 $7.34,Fable 5 为 $12.69。
  • 模型切换产生的缓存未命中成本已计入报告的节省数据,而非被排除在外。
  • Grok 4.5 是强制性的路由选项,Balance 和 Intelligence 按被路由模型的费率计费。

来源:Cursor Router 发布文章、Cursor Router 更新日志、Grok 4.5 公告,以及 X 上的 @cursor_ai