NVIDIA 推出 Nemotron 3.5 Lightning 和 NeMo Switchyard,以打造更智能、更高效的 Agentic AI
要点速览
- •Nemotron 3.5 Lightning 是一款完全可定制的开源 300 亿参数 mixture-of-experts 模型,面向 agentic AI 工作流中的高吞吐专项任务。
- •NVIDIA 表示,与同类其他模型相比,Nemotron 3.5 Lightning 的输出速度最高可提升 4 倍,agentic 任务完成速度可提升 30%。
- •NeMo Switchyard 是一个开源路由库,可自动将每个提示词导向最强大、最具成本效益的模型,将任务完成成本降至约单一前沿模型方案的三分之一。
- •该模型支持在本地系统、边缘设备、工作站、数据中心和云环境中灵活部署,帮助组织在延迟、隐私和基础设施复用之间取得平衡。
- •NVIDIA 还发布了配套的 agentic 强化学习数据集 Nemotron-RL-Agentic-Terminal-Pivot,用于支持编码代理能力的后训练。

随着人工智能从聊天机器人界面转向自主代理,开源模型正越来越多地满足企业对部署地点、运行方式以及模型演进的控制需求。
NVIDIA 今日宣布扩展其 Nemotron 3 模型家族,发布 Nemotron 3.5 Lightning。这是一款 300 亿参数的 mixture-of-experts 模型,定位为长时间运行的 agentic AI 工作负载中同类产品里最高效率的选择。此次发布延续了 Nemotron 3 Nano,体现了 NVIDIA 持续提升开源模型准确性和速度的努力。
与此同时,NVIDIA 还推出了 NeMo Switchyard,这是一个用于常见 agent 开发工具内部智能路由的开源库。企业可基于自身需求构建路由器;部署后,NeMo Switchyard 能自动将每个请求定向到最适合该任务、且能力最强的模型,而无需开发者重写应用。
Nemotron 3.5 Lightning 和 NeMo Switchyard 共同为组织在 AI 的部署方式、运行位置和运行效率方面提供更大的控制力——覆盖 PC、工作站、数据中心和云基础设施,随着 agentic 系统从单模型聊天体验走向工作流级自动化,这种控制尤为重要。
常驻运行的代理需要模型系统
现代 agentic 系统——即常驻运行的代理——越来越多地以专门化模型的组合形式运行,每个模型针对不同任务进行优化。NVIDIA 为这种架构设计了 Nemotron 开源模型。像 Nemotron 3 Ultra 或 GPT-5.6 这样的前沿推理模型可以规划并协调整体工作流,而像 Nemotron 3.5 Lightning 这样的小型专用模型则可执行代码审查、工具使用、安全告警监控和账单问题回答等定向任务。
Nemotron 3.5 Lightning:面向高吞吐专项任务
Nemotron 3.5 Lightning 是一款完全可定制的开源模型,专为驱动常驻运行代理的高吞吐任务而构建。该模型由 Nemotron Coalition 贡献开发,联盟成员提供了评估方法、推理软件和数据集,以帮助推进模型能力。
根据 NVIDIA 的说法,Nemotron 3.5 Lightning 的输出速度最高可提升 4 倍,与同类其他模型相比,agentic 任务完成速度可快 30%。由于该模型开源且可定制,组织可以使用 NVIDIA NeMo 在自身领域数据、工具和工作流上对其进行后训练,从而提升专项用例的准确性。
跨行业的多家 AI 领导者已经在为各自工作负载定制 Nemotron 3.5 Lightning:
- CrowdStrike 将该模型用于网络安全场景。
- Harvey 与 Trajectory 合作,将其用于法律服务。
- CodeRabbit 与 Baseten 合作,将其用于代码审查。
- Lila Sciences 正利用该模型提升物理与生命科学领域 agentic 任务的推理能力。
- Fastino Labs 已对该模型进行定制,并表示其在软件开发、金融和医疗保健工作负载上获得了领先的准确率。
Nemotron 3.5 Lightning 还为组织提供了隐私和部署灵活性。它可在本地 AI 系统上运行——包括 NVIDIA RTX PCs、NVIDIA DGX Spark、NVIDIA DGX Station 和 NVIDIA Jetson——帮助用户最大化利用现有基础设施。它也可扩展至边缘 AI 设备、NVIDIA RTX PRO workstations、数据中心和云环境,适用于企业应用。对于需要快速响应的高吞吐专项任务,该模型可本地运行或在本地部署,这对需要平衡延迟、隐私和基础设施复用的组织尤为重要。
此外,与此前每次 Nemotron 发布一样,NVIDIA 会在许可允许范围内公开尽可能多的训练数据和方法,从而支持可追溯性、审计以及其他模型的训练。除 Lightning 之外,NVIDIA 还发布了 Nemotron-RL-Agentic-Terminal-Pivot,这是一个 agentic 强化学习数据集,用于对该模型进行后训练,以增强编码代理能力。
借助模型路由打造更高效的 AI 应用
不同模型擅长的任务各不相同——有些适合编码,有些适合推理,有些适合轻量任务,还有些针对本地运行进行了优化,以获得更高的隐私和效率。如果客户始终依赖单一默认模型,可能会导致过度支出或质量下降;而如果手动管理路由,则会带来集成工作,进而拖慢部署。
NeMo Switchyard 是一个面向 AI 代理的开源模型路由库。该技术会根据具体需求,在代理工作流的每一步自动将提示词路由到最强大、最高效的模型。代理应用开发者可以通过不同的路由算法对路由器进行调优或修改,以匹配质量、延迟和成本等优先级。在模型系统中,企业可以借助更优的 tokenomics 构建强大的 AI 代理。
内部基准测试显示,NeMo Switchyard 在保持前沿水平准确率的同时,将任务完成成本降低至仅使用 Opus 4.8 的约三分之一。
NVIDIA 正与 AI 生态系统中的合作伙伴协作,将智能模型路由引入开发者已经在使用的工具和平台。
Boomi:在五种路由能力上评估了 Switchyard,实现 100% 的领域路由准确率,将 59% 的流量发送至一个速度快 5 倍的微调模型,并将后续轮次延迟降低 21%。
Cadence:在正式验证用例中使用 ChipStack AI Super Agent,将效率提升 9.9%。
Classmethod:正在内部使用 NeMo Switchyard 运行 opencode 和 Fireworks 工作负载,初步测试显示在保持质量的同时成本降低 27%。
Cognition:将 NVIDIA NeMo Switchyard staged router 集成到 Devin Desktop 供 NVIDIA 内部使用,在 FrontierCode Main 上实现接近前沿水平的表现,同时相较于将所有请求路由至单一底层前沿模型,平均成本降低 28%。
Kong:通过 Kong AI Gateway 原生提供 NeMo Switchyard 路由能力。
LangChain:在 145 个多轮 Deep Agents 任务中,仅将 7% 的调用路由到前沿模型,就实现了 74% 的成本下降,但准确率下降 6%。
LiteLLM:正将 NeMo Switchyard 作为插件加入其代理层,使开发者无需修改现有技术栈即可获得这些优势。
Nous Research:已将 NeMo Switchyard 集成到 Hermes 中,为开发者提供一个易于配置的路由系统,以提升代理效率。
Ramp:在 Ramp SWE-Bench 中使用 NeMo Switchyard,在将成本降低 58%、运行时间降低 33% 的同时,达到与前沿模型相当的表现。
Siemens:正在对其 Fuse EDA AI Agent 进行基准测试,以提升效率。
Nemotron 3.5 Lightning 已在 Hugging Face、ModelScope、OpenRouter 和 build.nvidia.com 上以 NVIDIA NIM microservice 形式提供,同时也可通过广泛的 NVIDIA Cloud Partners、后训练平台、推理平台和云服务提供商生态获取。NeMo Switchyard 已在 GitHub 上提供,并即将登陆合作伙伴平台。