新闻股票NVIDIA 扩展 Nemotron 3 系列,推出面向 AI 智能体工作负载的 30B 开源 MoE 模型 Nemotron 3.5 Lightning

NVIDIA 扩展 Nemotron 3 系列,推出面向 AI 智能体工作负载的 30B 开源 MoE 模型 Nemotron 3.5 Lightning

作者: Hokanews·

要点速览

  • Nemotron 3.5 Lightning 采用 Mixture-of-Experts 设计,在 300 亿总参数中约有 30 亿参数在运行时被激活。
  • NVIDIA 表示,该模型针对始终在线、低延迟的智能体工作负载进行了优化,而不仅仅是复杂推理任务。
  • 公司报告称,该模型在 10,000 项任务上的完成速度比 Qwen3.6 35B 快 30%,并且在同类模型中输出速度最高可达 4 倍。
  • NVIDIA 以 OpenMDW-1.1 许可发布模型权重、训练数据和 recipes,并支持通过 NeMo 工具进行微调。
  • NVIDIA 还推出了 NeMo Switchyard,用于在大型推理模型与像 Nemotron 3.5 Lightning 这样的执行型小模型之间进行任务路由。
NVIDIA 扩展 Nemotron 3 系列,推出面向 AI 智能体工作负载的 30B 开源 MoE 模型 Nemotron 3.5 Lightning

NVIDIA 已扩展其 Nemotron 3 系列人工智能模型,发布了 Nemotron 3.5 Lightning,这是一款 300 亿参数的开源 Mixture-of-Experts(MoE)模型,专门面向高频 AI 智能体工作负载。

这款新模型面向的是不断运行的一类 AI 应用,能够处理工具调用、数据处理、软件操作、结果验证以及不同 AI 系统之间的通信等任务。NVIDIA 表示,Nemotron 3.5 Lightning 的输出速度最高可达同类模型的 4 倍,并且在相近准确率水平下,大批量智能体任务的完成速度最高可快 30%。

此次发布为 NVIDIA 不断扩展的 AI 战略增加了新的层次。该公司不再只是提供运行 AI 系统所需的处理器,而是越来越多地开发模型、软件和工具,帮助企业在 NVIDIA 硬件上构建和部署 AI 应用。这使 NVIDIA 不仅要面对 AMD 和 Intel 等芯片厂商,也要在开源权重 AI 市场中与 Meta(Llama)、Alibaba(Qwen)、Mistral AI 和 Google(Gemma)等模型提供商竞争。

NVIDIA 瞄准 AI 智能体的下一阶段

随着 AI 智能体成为科技行业的重点,最新的 Nemotron 模型也随之发布。传统 AI 助手通常只回应单个提示;而智能体则可以将更大的目标拆解为多个动作,使用外部工具,检索信息,执行命令,并在继续之前评估结果。包括 OpenAI、Anthropic、Google 和 Microsoft 在内的公司都已表明,具备更高自主性的 agentic AI 代表着关键前沿。

这些系统会产生大量模型调用。例如,一个 AI 编程智能体可能需要反复检查文件、执行命令、查看错误、修改代码并运行测试,才能完成单一任务。每一步未必都需要最强大的推理模型——开发者更可能希望使用一个能够快速高效执行重复任务的小型模型。

这正是 NVIDIA 通过 Nemotron 3.5 Lightning 试图切入的市场。该公司表示,这款模型优化的是高频、低延迟的执行,而不是仅用于最复杂的推理工作负载。

300 亿参数模型,激活参数为 30 亿

Nemotron 3.5 Lightning 的关键技术特征之一是其 Mixture-of-Experts 架构。尽管该模型总参数量为 300 亿,NVIDIA 表示,在一次前向传递中,实际激活的参数约为 30 亿。这使模型能够保留更大系统的容量,同时减少每个 token 所需的计算量。MoE 架构近年来在行业内获得了广泛采用,DeepSeek-V3、Mistral 的 Mixtral 和 xAI 的 Grok 等模型都采用了类似方式,在不按比例增加推理计算的情况下扩展参数规模。

在传统稠密模型中,几乎整个参数集合都会参与每次输入处理。MoE 模型的工作方式不同:路由系统决定由哪些专家处理特定 token 或任务的一部分,只有被选中的专家会被激活,从而在维持大规模参数池的同时降低计算量。

NVIDIA 表示,这种设计使 Nemotron 3.5 Lightning 适合速度和效率都至关重要的高频工作负载。该模型拥有 300 亿总参数和 30 亿激活参数,在更广泛的 Nemotron 3 家族中属于较小成员,但仍保留了面向复杂智能体工作流的能力。

为始终在线的 AI 而设计

“always-on AI agents(始终在线的 AI 智能体)”是 NVIDIA 对这款新模型定位的核心。公司认为,长时间运行的智能体大部分时间都在执行相对常规的操作,而非复杂推理。这些操作包括工具调用、结果验证、信息格式化、文件检索以及将任务分派给其他模型。

如果每个单独操作都使用大型前沿推理模型,可能会同时增加延迟和计算成本。NVIDIA 的做法是将工作负载分配给不同模型:更大的模型负责战略规划和复杂推理,而 Nemotron 3.5 Lightning 负责重复性的执行步骤。NVIDIA 将其描述为一个“模型系统”,而不是由单一模型负责所有任务。

速度是核心特性

NVIDIA 正在强调推理速度是 Nemotron 3.5 Lightning 的定义性特征之一。公司表示,在 PinchBench 上,该模型在完成 10,000 项任务时,以相近准确率比 Qwen3.6 35B 快 30%,并达到了 86% 的准确率。NVIDIA 还称,Nemotron 3.5 Lightning 在 Artificial Analysis Intelligence Index 中达到了准确率与速度的 Pareto 前沿。

这些数据都是 NVIDIA 自行报告的结果,而非独立验证。不过,对吞吐量的强调反映了 AI 市场的发展方向。随着 AI 进入生产环境,开发者越来越关注模型完成真实工作负载的速度与效率,而不仅仅是其在单个基准题上的表现。

为什么推理效率如此重要

训练大型 AI 模型因所需的巨大计算资源而备受关注,但推理正在成为 AI 经济同样重要的一部分。行业分析师估计,随着模型从开发阶段进入服务数十亿查询的正式生产环境,推理已经占据了 AI 总体算力支出的重要且不断增长的份额。每当 AI 系统响应请求、生成代码、检索信息或完成自动化任务时,都会消耗计算资源。对于持续运行的 AI 智能体而言,这些成本会迅速累积。

如果一个模型在需要更少激活参数的同时还能更快地产生响应,那么它有可能减少特定工作负载所需的计算基础设施。NVIDIA 的最新模型正是针对这样一个现实问题:如何让自主 AI 系统持续运行,同时避免每个单独任务都变得过于昂贵。

可定制性是另一大卖点

NVIDIA 也将 Nemotron 3.5 Lightning 定位为可定制模型。公司表示,开发者可在宽松的 OpenMDW-1.1 许可结构下获得模型权重、训练数据和 recipes,从而将模型适配到特定应用。

这一点很重要,因为企业通常需要 AI 系统理解专业术语、内部流程和专有工作流。通用模型或许能够写代码或回答问题,但在特定行业部署 AI 智能体的公司,可能更希望模型围绕自身流程进行训练或微调。

NVIDIA 表示,开发者可通过 NVIDIA 的 NeMo 工具,使用 LoRA 或完整监督微调来调整 Nemotron 3.5 Lightning。开发者还可以使用强化学习和基于环境的评估进一步定制模型。

开放权重 AI 让开发者拥有更多控制权

此次发布也体现了 NVIDIA 持续推进开放权重 AI 的策略。与其强制开发者只能通过专有 API 访问模型,开放权重模型可以为部署提供更多控制权。企业可以在自己的基础设施上运行模型,针对特定用例进行调整,并将其整合进现有 AI 系统。

这对于处理敏感信息的企业尤其重要。一些机构可能更愿意将推理工作负载保留在内部基础设施中,而不是将数据发送到外部 AI 服务。Nemotron 3.5 Lightning 被设计为可部署在 NVIDIA 的硬件生态系统中,从公司紧凑型 DGX Spark 平台到更大型的数据中心环境均可覆盖。

面向本地与数据中心部署而设计

该模型相对高效的架构,也使 NVIDIA 有机会不只面向传统云数据中心。根据 NVIDIA 的模型文档,在某些配置下,Nemotron 3.5 Lightning 可以运行在单个 DGX Spark 系统或一块 H100 GPU 上。它也支持 NVIDIA Blackwell 硬件和 Hopper 代 GPU,并可通过受支持的推理框架获得额外部署选项。

这种灵活性让该模型既适合在本地系统上试验自主智能体的开发者,也适合运行大规模生产环境的企业。能在不同基础设施配置下运行同一模型,也有助于简化开发和测试。

混合架构

Nemotron 3.5 Lightning 并非完全依赖传统 Transformer 架构。NVIDIA 将其描述为一个混合系统,结合了 Mamba-2、Mixture-of-Experts 层以及选定的 attention 层。该架构旨在在计算效率与处理复杂序列的能力之间取得平衡。Mamba 风格组件可降低序列处理过程中的部分内存需求,而 MoE 层则允许模型在不为每个 token 激活全部参数的情况下扩展总参数量。对于需要 token 之间精细关系的任务,attention 层仍然很重要。

通过结合这些方法,NVIDIA 试图打造一个既能提供高吞吐量、又不牺牲智能体工作流所需能力的模型。

上下文长度最高可达 1 百万 token

另一个值得注意的规格是模型的上下文容量。NVIDIA 的模型文档显示,其支持的上下文长度最高可达 1 百万 token。

对于需要处理大量文档、源代码仓库、日志或长期任务历史的 AI 智能体而言,较大的上下文窗口非常有用。例如,负责大型软件项目的智能体可能需要访问大量文件和先前交互。更长的上下文可以减少反复总结或丢弃信息的需要。

不过,更大的上下文窗口并不意味着所有应用都会同等受益。实际表现取决于工作负载、推理配置和硬件条件。尽管如此,这一能力仍显示出 NVIDIA 对面向长流程和复杂任务的 AI 系统的重视。

来源:X post

Nemotron 3.5 Lightning 加入不断扩大的家族

此次发布进一步扩展了已有规模更大的 Nemotron 3 家族。NVIDIA 之前已经推出多款面向不同 AI 工作负载层级的模型,包括用于高效执行的小型模型,以及用于复杂推理和多智能体应用的大型系统。

该公司的策略越来越建立在专业化之上。NVIDIA 不再假设一个模型应该完成所有工作,而是在构建一个具有不同优势的模型集合。Nemotron 3.5 Lightning 被定位在高频执行这一侧,这意味着它更可能与更大型的推理系统形成互补,而不是直接取代它们。

NVIDIA 通过 NeMo Switchyard 引入模型路由

除了新模型之外,NVIDIA 还在推广 NeMo Switchyard,这是一个用于将任务路由到不同模型的库。其概念相对直接:系统可以判断某项任务是否需要强大的推理模型,或者较小、更快的模型是否就能完成。例如,一个复杂的规划请求可以发送给前沿推理系统,而重复性的执行任务则可以交给 Nemotron 3.5 Lightning。

NVIDIA 表示,Switchyard 允许开发者将 Lightning 与开放和封闭模型一起暴露出来,并根据需求路由单个请求。如果这种模型路由方法广泛普及,AI 应用可能会越来越像由专业化模型组成的网络。

AI 智能体的经济学

AI 智能体的经济性可能成为行业下一阶段最重要的问题之一。聊天机器人也许只回应用户一次,而自主智能体可能需要执行数百甚至数千次操作才能完成一个目标。这意味着每个单独操作的成本都很重要。

如果开发者能够用更小的模型处理常规执行,并为困难决策保留昂贵的推理模型,那么整个 AI 系统的总成本就有可能下降。NVIDIA 押注这种分工将成为大规模 agentic 系统的标准架构,而 Nemotron 3.5 Lightning 正是为此角色而设计。

编程是重要用例

软件开发是 AI 智能体已经越来越活跃的领域之一。编程智能体可以检查代码仓库、编写程序、执行测试、识别错误并进行修正——这些流程都涉及与工具的反复交互。因此,一个针对快速执行进行优化的模型,能够直接影响编程智能体的速度。

NVIDIA 的文档将编程和 agentic 工作负载列为该模型的目标应用之一,包括软件开发和工具使用场景。公司还表示,该模型的训练数据包含与编程、工具调用、结构化输出和多步骤工作流相关的数据。这使其区别于主要面向传统对话应用的系统。

企业应用的潜力可能很大

企业同样是 Nemotron 3.5 Lightning 的重要目标市场。公司正在尝试将 AI 智能体用于客户支持、内部研究、文档处理、IT 运维、软件开发和工作流自动化等场景。其中许多应用都包含重复步骤:客服智能体可能检索账户信息、验证请求并更新记录;IT 智能体可能执行命令并检查所请求的变更是否成功。

这些任务并不总是需要最深层的推理,但它们确实需要可靠性和速度。这正是 NVIDIA 认为 Nemotron 3.5 Lightning 可以发挥作用的地方。

NVIDIA 更广泛的 AI 战略

此次发布也展示了 NVIDIA 的 AI 业务如何超越 GPU 继续扩张。该公司仍然是全球最重要的加速计算硬件供应商之一,但其战略越来越多地涵盖建立在这些硬件之上的软件层和模型层。通过发布开放模型和开发工具,NVIDIA 可以鼓励开发者构建最终运行在 NVIDIA 基础设施上的 AI 系统。

Nemotron 因此成为 NVIDIA 试图确立自身为全栈 AI 平台的更广泛努力的一部分。公司争夺的不仅是硬件竞争对手,也包括提供自身 AI 软件栈的云服务商。

开源 AI 模型竞争日益激烈

NVIDIA 正进入一个竞争极为激烈的开源模型市场。开发者可以接触到来自众多科技公司和研究机构的模型。竞争早已不再只是参数规模的较量,开发者越来越依据推理速度、准确率、上下文长度、许可方式、可定制性、硬件需求和工具使用能力来评估模型。

一个能力略弱但速度明显更快的模型,可能对生产环境中的 AI 智能体更有用。这正是 Nemotron 3.5 Lightning 所瞄准的市场。其价值最终将取决于开发者是否认为它的性能和可定制能力,相较于其他开源模型更具吸引力。

Lightning 模型有何不同?

最重要的区别在于其目标工作负载。Nemotron 3.5 Lightning 并未被定位为一个需要承担所有 AI 任务的单一模型。相反,NVIDIA 将其视为高效的执行型工具。

该模型可以高频执行常规操作,而更大型的推理模型则专注于战略决策。这类似于传统软件系统如何在专业化组件之间分配工作负载。不同之处在于,AI 模型现在可以根据复杂性动态拆分任务,这可能使 AI 系统在规模扩大时更高效。

NVIDIA 的性能说法仍需独立评估

NVIDIA 声称其 token 生成速度最高可快 4 倍、完成速度提升 30%,这些说法很重要,但需要放在具体语境中看待。基准结果会因硬件、软件配置、批量大小、序列长度和竞争模型的不同而变化。

NVIDIA 报告称,Nemotron 3.5 Lightning 在 Artificial Analysis Intelligence Index 中达到了准确率与速度的 Pareto 前沿,并在 PinchBench 上取得 86% 的结果,在完成 10,000 项任务时比所引用的竞争模型更快。随着模型在不同工作负载中部署,独立开发者和研究人员最终将提供更全面的评估。

模型权重和文档的发布应当有助于这类测试。

开放模型生态可能受益

开放权重发布让研究人员和开发者能够在受控厂商演示之外观察模型的实际表现。这可能带来更多对比、微调实验和专业化应用。NVIDIA 此次发布包含模型权重和额外资源,旨在支持定制化。

公司还提供了与推理框架和硬件平台的集成路径。这可能加速那些希望在不从零构建模型的情况下尝试 agentic 系统的开发者采用该模型。

这对 NVIDIA 投资者意味着什么

对于关注 NVDA 股票的投资者而言,Nemotron 3.5 Lightning 的发布不太可能像重大 GPU 产品公告那样带来同等程度的直接财务影响。不过,它体现了一个重要的战略趋势:NVIDIA 正试图让自己的技术栈在 AI 开发中扮演越来越核心的角色。

如果开发者同时使用 NVIDIA 的模型、优化库和硬件,公司就能从 AI 生态系统的多个层面受益。模型本身未必是主要收入来源;其战略价值可能在于帮助巩固 NVIDIA 作为 AI 应用开发与部署平台的地位。

AI 的下一阶段可能是效率竞争

生成式 AI 的第一阶段由模型规模主导。各家公司竞相构建越来越大的系统,追求更强的推理能力。下一阶段可能会更聚焦于效率。

企业需要能够持续运行的 AI,需要可预测的成本,需要快速响应,需要能与软件工具和内部数据集成的系统,也需要能适配特定任务的模型。

Nemotron 3.5 Lightning 体现了这一转变。其 300 亿参数架构、30 亿激活参数设计以及对高频智能体执行的关注,都是为了让 AI 在规模化条件下更实用。

Coin Bureau 与更广泛的 AI 讨论

此次发布也在科技与加密货币相关的社交媒体社区中引发关注,包括与 Coin Bureau 账号相关的讨论。不过,本报道中的主要技术信息来自 NVIDIA 自身的公告和模型文档。我无法独立核实一条确认性能说法的具体 Coin Bureau 帖文,因此这些说法应归于 NVIDIA,而不是被视为由 Coin Bureau 独立验证。

随着 AI 公司越来越多地发布可能因测试条件不同而变化的性能数据,这一区分非常重要。

Nemotron 接下来会怎样?

对 Nemotron 3.5 Lightning 来说,最重要的考验将是真实世界的采用情况。开发者将决定该模型能否轻松集成到现有智能体框架中;企业将评估其可靠性和可定制能力;研究人员将把它与其他开放权重模型进行比较;基础设施提供商则会判断它在不同规模下的运行效率。

如果开发者发现该模型能够在保持较高准确率的同时,可靠地处理大量常规智能体任务,NVIDIA 便可能为正在形成的智能体经济提供一个强大的新组件。

更大的图景

Nemotron 3.5 Lightning 的发布反映了人工智能领域的更广泛转变。AI 正从仅仅回答问题的系统,转向能够执行工作的系统。

这一转变需要能够持续运行、与软件工具交互并处理大量单独操作的模型。对于这类任务,最强大的推理模型未必总是最佳选择。有时,速度、效率和可定制性更为重要。

NVIDIA 正是围绕这一思路来定位 Nemotron 3.5 Lightning 的。该模型将大型总参数池与稀疏激活、混合架构、长上下文支持以及定制工具结合起来。它的目标不一定是取代最大的 AI 模型,而是与它们协同工作。

结论

NVIDIA 已将 Nemotron 3 系列扩展为 Nemotron 3.5 Lightning,这是一款 300 亿参数的开源 MoE 模型,约有 30 亿激活参数。

该模型专为始终在线的 AI 智能体中的高频执行而设计,包括工具调用、编程工作流、结果验证以及其他重复性任务。NVIDIA 表示,Nemotron 3.5 Lightning 的输出速度最高可达同类模型的 4 倍,并且在相近准确率下完成 10,000 项智能体任务的速度比一款所引用的竞争模型快 30%。这些数据仍属于厂商报告的性能说法,应在不同硬件和工作负载下独立评估。

该模型还支持定制化,NVIDIA 已发布权重和训练资源,开发者可借助这些资源进行微调和强化学习。其架构结合了 Mamba-2、MoE 和 attention 组件,并支持最高 1 百万 token 的上下文长度。

此次发布的更广泛意义或许在于其对效率的关注。随着 AI 智能体变得更加自主,并被期望执行数千次单独操作,NVIDIA 提出的方案是将工作拆分:大型推理模型负责复杂规划,而像 Nemotron 3.5 Lightning 这样的小型专业模型则快速执行常规任务。

在 NeMo Switchyard 的支持下,这种模型路由策略有可能成为企业 AI 架构中的重要组成部分。