NVIDIA 推出 Nemotron 3.5 Lightning 與 NeMo Switchyard,打造更智能、更高效的代理式 AI
重點速覽
- •Nemotron 3.5 Lightning 是一個完全可自訂的開源 300 億參數混合專家模型,專為代理式 AI 工作流程中的高頻率專業化任務而設計。
- •NVIDIA 表示,Nemotron 3.5 Lightning 的輸出速度提升達 4 倍,代理式任務完成速度較同類其他模型快 30%。
- •NeMo Switchyard 是一個開源路由庫,能自動將每個提示詞引導至最適合且最具成本效益的模型,將任務完成成本降至僅依賴單一前沿模型的三分之一左右。
- •該模型支援跨本地系統、邊緣裝置、工作站、資料中心及雲端環境的彈性部署,讓組織能在延遲、隱私與基礎設施複用之間取得平衡。
- •NVIDIA 同時發布了配套的代理式強化學習資料集 Nemotron-RL-Agentic-Terminal-Pivot,以支援程式碼代理能力的後訓練。

隨著人工智慧從聊天機器人介面轉向自主代理,開源模型正日益滿足企業對部署位置、運作參數及模型演進的掌控需求。
NVIDIA 宣布擴展其 Nemotron 3 模型家族,推出 Nemotron 3.5 Lightning——一個擁有 300 億參數的混合專家模型,定位為同類中效率最高的長時間運行代理式 AI 工作負載解決方案。此次發布接續 Nemotron 3 Nano,延續 NVIDIA 持續優化開源模型以提升準確度與速度的努力。
除了新模型外,NVIDIA 同時推出 NeMo Switchyard,一個專為主流代理開發工具設計的智能路由開源庫。該庫讓企業能夠根據自身需求建構路由器,自動將每個請求引導至最適合、最高效的模型,而無需重新編寫應用程式。
Nemotron 3.5 Lightning 與 NeMo Switchyard 共同為組織提供對 AI 部署、運行位置及運作效率的更大掌控權,涵蓋個人電腦、工作站、資料中心與雲端基礎設施,隨著代理式系統從單一模型的聊天體驗邁向工作流程層級的自動化。
常駐型代理與模型系統架構
現代代理式系統——其特徵為常駐型代理——日益以專業化模型的集合形式運作,每個模型針對不同任務進行優化。NVIDIA 的 Nemotron 開源模型即是為此架構而設計。前沿推理模型如 Nemotron 3 Ultra 或 GPT-5.6 可負責規劃和協調整體工作流程,而較小的專業化模型如 Nemotron 3.5 Lightning 則執行特定任務,例如程式碼審查、工具使用、安全警示監控及帳務查詢。
Nemotron 3.5 Lightning:為高頻率專業化任務而生
Nemotron 3.5 Lightning 是一個完全可自訂的開源模型,專為驅動常駐型代理的高頻率任務而開發。該模型的建構得到了 Nemotron Coalition 的貢獻,其成員提供了評估方法、推論軟體和資料集,以推進模型的能力。
根據 NVIDIA 的資料,Nemotron 3.5 Lightning 的輸出速度提升達 4 倍,使代理式任務完成速度較同類其他模型快 30%。由於該模型是開源且可自訂的,組織可使用 NVIDIA NeMo 在自身的領域資料、工具和工作流程上進行後訓練,以提升專業化應用場景的準確度。
多家跨產業的 AI 領導企業已在為其特定工作負載自訂 Nemotron 3.5 Lightning:
- CrowdStrike 正將該模型應用於網路安全場景。
- Harvey 與 Trajectory 合作,將其部署於法律服務領域。
- CodeRabbit 與 Baseten 合作,將其用於程式碼審查。
- Lila Sciences 正利用該模型提升物理科學與生命科學領域代理式任務的推理能力。
- Fastino Labs 已自訂該模型,並在軟體開發、金融與醫療保健工作負載中報告了領先的準確度。
Nemotron 3.5 Lightning 同時為組織提供隱私與部署彈性。它可在本地 AI 系統上運行——包括 NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station 和 NVIDIA Jetson——協助使用者最大化現有基礎設施的投資。它也可擴展至邊緣 AI 裝置、NVIDIA RTX PRO 工作站、資料中心及雲端環境,用於企業級應用。對於需要快速回應的高頻率、專業化任務,該模型可在本地或內部部署環境中運行,這對需要在延遲、隱私與基礎設施複用之間取得平衡的組織而言尤為重要。
與先前的 Nemotron 發布一致,NVIDIA 在授權許可範圍內盡可能公開訓練資料與方法,以支援可追溯性、稽核及後續模型訓練。除 Lightning 外,NVIDIA 還發布了 Nemotron-RL-Agentic-Terminal-Pivot,這是一個代理式強化學習資料集,用於對模型進行程式碼代理能力的後訓練。
NeMo Switchyard:適用於 AI 代理的高效模型路由
不同模型擅長不同任務——部分針對程式碼開發進行優化,部分擅長推理,部分適合輕量級操作,部分則為隱私保護而優化為本地運行。依賴單一預設模型可能導致過度支出或品質下降,而手動路由則會引入整合負擔,可能拖慢部署速度。
NeMo Switchyard 透過自動將提示詞路由至代理工作流程中每個步驟最適合且最高效的模型來解決此問題。開發者可使用不同的演算法調整路由器,以符合品質、延遲和成本等優先考量。NVIDIA 的內部基準測試顯示,NeMo Switchyard 在維持前沿模型水準準確度的同時,將任務完成成本降至僅使用 Opus 4.8 單一模型的三分之一左右。
對於建構正式上線代理的團隊而言,該路由層是介於一體適用推論與為每個應用進行自訂協調之間的實務折衷方案。NVIDIA 正與 AI 生態系中的合作夥伴合作,將智能模型路由整合至現有的開發者工具和平台中。初步成果包括:
- Boomi:在五項路由能力上評估了 Switchyard,達到 100% 的領域路由準確度,將 59% 的流量引導至速度快 5 倍的微調模型,並將後續回合延遲降低 21%。
- Cadence:在形式驗證場景中使用 ChipStack AI Super Agent,將效率提升了 9.9%。
- Classmethod:在內部使用 NeMo Switchyard 運行 opencode 和 Fireworks 工作負載,初步測試顯示在維持品質的同時降低了 27% 的成本。
- Cognition:將 NeMo Switchyard 分階段路由器整合至 Devin Desktop 供 NVIDIA 內部使用,在 FrontierCode Main 上達到接近前沿模型的效能,同時將平均成本較全部請求路由至單一前沿模型降低 28%。
- Kong:透過 Kong AI Gateway 原生提供 NeMo Switchyard 路由功能。
- LangChain:在 145 個多回合 Deep Agents 任務中,透過 NeMo Switchyard 僅將 7% 的呼叫路由至前沿模型,即實現了 74% 的成本降低,準確度權衡為 6%。
- LiteLLM:將 NeMo Switchyard 作為外掛程式加入其代理層,讓開發者无需修改現有技術堆疊即可獲得路由優勢。
- Nous Research:將 NeMo Switchyard 整合至 Hermes,為開發者提供易於設定的路由系統。
- Ramp:在 Ramp SWE-Bench 中使用 NeMo Switchyard,在匹配前沿模型效能的同時,將成本降低 58%、運行時間縮短 33%。
- Siemens:正在進行基準測試,以提升其 Fuse EDA AI Agent 的效率。
可用性
Nemotron 3.5 Lightning 可在 Hugging Face、ModelScope、OpenRouter 和 build.nvidia.com 上以 NVIDIA NIM 微服務形式取得,同時也可透過廣泛的 NVIDIA 雲端合作夥伴生態系、後訓練平台、推論平台和雲端服務提供商取得。NeMo Switchyard 可在 GitHub 上取得,預計近期內登陸合作夥伴平台。