新聞宏觀經濟Cursor 推出 Cursor Router:以低 30–50% 成本提供前沿程式設計品質的請求層級分類器

Cursor 推出 Cursor Router:以低 30–50% 成本提供前沿程式設計品質的請求層級分類器

作者: MarkTechPost·

重點速覽

  • Cursor Router 是一個以超過 600,000 筆即時請求訓練而成的每請求分類器,會分析查詢、上下文、任務複雜度與領域,在執行前將每個請求路由至最合適的 AI 模型。
  • 涵蓋數百萬筆即時請求的線上 A/B 測試顯示,其在約 60% 成本節省下仍可達到前沿品質表現;三個早期存取企業帳戶相較 Opus 4.8 回報節省 30% 至 50%。
  • 該路由器在訓練與評估中都具備快取感知能力,這代表所有回報節省數字都已包含對話中途切換模型造成快取未命中的實際成本,而非將其排除。
  • Grok 4.5 是強制性的價格效率路由選項,無法透過模型封鎖清單排除;Balance 與 Intelligence 模式則按每次路由請求所選模型的可變費率計費。
  • 三種模式的每次提交成本分別為 Auto Balance $4.63、Auto Intelligence $6.76、Opus 4.8 $7.34、Fable 5 $12.69,提供了超越每請求定價的結果導向成本比較。
Cursor 推出 Cursor Router:以低 30–50% 成本提供前沿程式設計品質的請求層級分類器

Cursor 已將 Cursor Router 對 Teams 與 Enterprise 方案全面開放。該系統是一個請求層級分類器,會在任何模型執行之前檢查每個傳入請求,然後將其分派給最適合該特定任務的模型。根據 Cursor 團隊表示,線上 A/B 測試顯示,其能以約 60% 的成本節省達到前沿品質表現,而三個早期存取企業帳戶則回報節省 30–50%。

Cursor Router 要解決的根本問題是支出模式,而非能力缺口。Cursor 表示,約 60% 的開發者會使用單一模型作為日常主力。因此,例行任務會以前沿層級價格完成,AI 支出成長速度也快於輸出品質改善速度。這種張力並非 Cursor 獨有;在 AI 程式設計助理市場中,Cursor 與 GitHub Copilot、Codeium、Tabnine 等產品競爭,供應商同樣面臨在多模型存取與每位開發者推論成本之間取得平衡的挑戰。Cursor Router 旨在解決這種不匹配。

分類器如何運作

Cursor Router 既不是備援鏈,也不是重試機制。它是一個以超過 600,000 筆即時請求訓練而成的分類器,並透過涵蓋數百萬筆即時請求的線上 A/B 測試進行評估,同時以使用者滿意度(AFC)作為其獎勵訊號進行最佳化。

對於每個請求,路由器會分析四項輸入:查詢、上下文、任務複雜度與領域。這些輸入會結合系統對各模型行為特徵的學習知識。Cursor 公布了三項由此分類衍生的路由規則:

  • 簡單工作會路由至最具價格效率的模型。
  • UI 更新會路由至最具審美判斷能力的模型。
  • 複雜且長期跨度的問題會路由至前沿推理模型。

第三項規則是成本論點的核心。節省並不是透過降低困難問題的模型等級來達成;而是將例行工作從前沿層級定價中移出,同時保持最困難任務層級不受影響。

一項值得注意的實作細節是:Cursor Router 在訓練與評估中都具備快取感知能力。它以一個會因路由而產生快取未命中的資料集訓練,且其回報的節省數字已包含這些快取未命中的成本。在對話中途切換模型會使提示快取失效,而這項成本是真實存在的——忽略這一點的路由器會高估其節省效果。提示快取可讓供應商以折扣重複使用先前處理過的上下文,已成為 Anthropic、OpenAI、Google 等主要模型供應商提供的標準降本功能,因此快取失效會成為任何模型切換系統中具有實質成本的副作用。

該分類器也被設計用來因應快速的模型更替。Cursor 表示,隨著新模型發布,路由器可以更新;在前沿能力幾乎每月變動的市場中,這是一項有意義的優勢。隨著 Anthropic、OpenAI、Google、xAI 等供應商在重疊時間表上發布更新模型,新的選項可能在團隊尚未完成現有模型評估前就已出現。

為何採用線上 A/B 測試而非離線評估

Cursor 有意避免將離線評估作為主要衡量方法。該公司表示,其原因在於離線評估存在樣本量小、與真實世界使用模式距離較遠,以及難以將成功結果簡化為標準化評分規則等問題。離線評估也無法計入模型切換時產生的快取未命中成本。

真實的路由決策發生在整段對話中,而不是單一回合。開發者會撰寫程式碼、提出後續問題、遇到錯誤並繼續處理——在一週內往往會產生數百個請求。路由器必須同時判斷要選擇哪個模型,以及何時在模型之間切換。

評估由兩項品質指標支撐:

  • 使用者滿意度:根據使用者回應分類代理的成功程度。使用者進入下一個功能被視為強烈正面訊號;修正代理則被視為強烈負面訊號。
  • 保留率:代理產生的程式碼在一段時間後仍保留於程式碼庫中的比例。

Cursor 團隊表示,過去九個月以來,它一直使用這兩項指標來評估每次模型發布與測試框架改進。這些指標早於其目前用來驗證的產品。保留率指標反映出對結果導向衡量的重視——也就是 AI 生成的程式碼是否得以保留——而非可能無法捕捉返工或下游失敗的任務完成率。

三種模式與背後數據

Auto 模式現在提供三種最佳化設定,讓使用者沿著成本–智慧的帕累托前沿移動:

  • Auto Intelligence 在使用者滿意度上接近 Fable,對團隊而言成本約低 60%。相較 Opus 4.8,它在成本幾乎相同的情況下將滿意度提升約 15%。
  • Auto Balance 在使用者滿意度上高於 Opus 4.8,成本約低 36%。相較 GPT-5.6 Sol,它以較低支出率提供相近滿意度。
  • Cost mode 被描述為在最佳化 token 支出的同時,達到良好品質並使用可用的最高智慧。Cursor 未公布此模式的 A/B 品質或成本數據。

由於每次請求成本只呈現部分情況,Cursor 也衡量了每次提交成本:

模型 / 模式每次提交成本
Auto Balance$4.63
Auto Intelligence$6.76
Opus 4.8$7.34
Fable 5$12.69

GPT-5.6 Sol 的成本與 Intelligence 模式相當,但使用者滿意度較低。Cursor 未公布其確切的每次提交成本。

部署與採購限制

Cursor Router 可用於桌面版、網頁版、iOS、CLI 與 Cursor SDK。Teams 方案預設啟用。Enterprise 管理員可從儀表板啟用。

變更日誌說明了管理介面:可按團隊與群組啟用、限制成員可選擇的最佳化模式、設定可配置的預設模式,以及模型允許清單與封鎖清單。若要標準化使用 Auto 模式,系統提供軟性與硬性強制執行選項。被路由的模型可以顯示或隱藏——預設為隱藏,因此希望具備路由透明度的團隊必須明確選擇啟用。

有兩項限制與採購規劃相關:

  1. Grok 4.5 是必要的價格效率路由選項,這意味著無法透過模型封鎖清單將其排除。Grok 4.5 於 July 8 發布,定價為每百萬輸入 token $2/M、每百萬輸出 token $6/M,快速版本則為 $4/M 與 $18/M。
  2. Balance 與 Intelligence 模式按被路由模型的費率計費,因此單位成本會隨每次路由決策變動,而不是固定為單一每次請求價格。

關鍵事實

  • Cursor Router 是一個每請求分類器,以 600,000+ 筆即時請求訓練,並針對使用者滿意度(AFC)最佳化。
  • 線上 A/B 測試顯示,以 60% 節省達到前沿品質輸出;三個早期存取企業帳戶相較 Opus 4.8 節省 30–50%。
  • 每次提交成本:$4.63(Balance)、$6.76(Intelligence),相較於 $7.34(Opus 4.8)與 $12.69(Fable 5)。
  • 模型切換造成的快取未命中成本已包含在回報節省中,而非被排除。
  • Grok 4.5 是強制路由選項,Balance 與 Intelligence 按被路由模型的費率計費。

來源:Cursor Router 發布文章、Cursor Router 變更日誌、Grok 4.5 公告,以及 X 上的 @cursor_ai