NVIDIA 擴展 Nemotron 3 系列,推出專為 AI Agent 工作負載設計的 30B 參數開源 MoE 模型 Nemotron 3.5 Lightning
重點速覽
- •Nemotron 3.5 Lightning 採用混合專家設計,300 億總參數中約有 30 億活躍參數。
- •NVIDIA 表示該模型針對常駐、低延遲的 Agent 工作負載進行了最佳化,而非僅用於複雜推理任務。
- •該公司報告稱,在 10,000 項任務上以相近準確率比 Qwen3.6 35B 快 30%,輸出速度達同類模型的四倍。
- •NVIDIA 以 OpenMDW-1.1 授權發布模型權重、訓練資料和方法,支援透過 NeMo 工具進行微調。
- •NVIDIA 還推出了 NeMo Switchyard,用於在大型推理模型和像 Nemotron 3.5 Lightning 這樣較小的執行型模型之間路由工作。

NVIDIA 擴展了其 Nemotron 3 人工智慧模型系列,推出了 Nemotron 3.5 Lightning——一款擁有 300 億參數的開源混合專家(MoE)模型,專為高吞吐量的 AI Agent 工作負載而設計。
這款新模型針對的是一類不斷增長的持續運作 AI 應用,負責處理工具調用、資料處理、軟體操作、結果驗證以及不同 AI 系統之間的通訊等任務。NVIDIA 表示,Nemotron 3.5 Lightning 的輸出速度可達同類模型的四倍,同時在相近準確率下完成大批量 Agent 任務的速度可提升至 30%。
這項公告為 NVIDIA 不斷擴展的 AI 戰略增添了新的層面。該公司不再僅專注於供應運行 AI 系統的處理器,而是日益投入開發模型、軟體和工具,協助企業在 NVIDIA 硬體上建構和部署 AI 應用。這使得 NVIDIA 不僅與 AMD 和 Intel 等晶片製造商競爭,也在開源權重 AI 市場中與 Meta(Llama)、阿里巴巴(Qwen)、Mistral AI 和 Google(Gemma)等模型提供商展開角逐。
NVIDIA 瞄準 AI Agent 的下一階段
最新的 Nemotron 模型正值 AI Agent 成為科技產業主要焦點之際推出。傳統 AI 助理通常回應單個提示,而 Agent 則能將更大的目標拆解為多個動作,使用外部工具、檢索資訊、執行命令,並在繼續之前評估結果。OpenAI、Anthropic、Google 和 Microsoft 等公司都已表明,具備更大自主性的 Agent AI 代表了一個關鍵前沿領域。
這些系統會產生大量的模型調用。例如,一個 AI 程式碼 Agent 可能需要反覆檢查檔案、執行命令、審查錯誤、修改程式碼和運行測試,才能完成單一任務。每個單獨的步驟可能不需要最強大的推理模型——開發者可能更偏好一個能夠快速且高效執行重複任務的較小模型。
這正是 Nemotron 3.5 Lightning 所瞄準的市場。NVIDIA 表示,該模型針對高吞吐量、低延遲的執行進行了最佳化,而非專門用於最複雜的推理工作負載。
300 億參數模型,30 億活躍參數
Nemotron 3.5 Lightning 的一項關鍵技術特性是其混合專家架構。雖然該模型包含 300 億總參數,但 NVIDIA 表示,在給定的前向傳播中,僅有約 30 億參數處於活躍狀態。這使得模型能夠保持一個實質上更大系統的容量,同時減少每個 Token 所需的計算量。MoE 架構已在業界獲得廣泛關注,DeepSeek-V3、Mistral 的 Mixtral 和 xAI 的 Grok 等模型都採用了類似方法,以在不按比例增加推理計算量的情況下擴展參數規模。
在傳統的稠密模型中,基本上整個參數集都參與處理每個輸入。而 MoE 模型的運作方式不同:路由系統決定哪些專家應該處理特定的 Token 或任務的某個部分。只有被選中的專家會被啟動,使系統能夠在維持龐大整體參數池的同時減少計算量。
NVIDIA 表示,這種設計使 Nemotron 3.5 Lightning 適用於速度和效率至關重要的高吞吐量工作負載。擁有 300 億總參數和 30 億活躍參數,它是更廣泛 Nemotron 3 家族中較小的成員之一,同時保留了為複雜 Agent 工作流程設計的能力。
為常駐 AI 而生
「常駐 AI Agent」的概念是 NVIDIA 對新模型定位的核心。該公司認為,長時間運行的 Agent 將大部分時間花在執行相對常規的操作上,而非複雜推理。這些操作包括進行工具調用、驗證輸出、格式化資訊、檢索檔案以及將任務委派給其他模型。
為每個單獨的操作運行大型前沿推理模型可能會同時增加延遲和計算成本。NVIDIA 的方法是將工作負載分配給不同的模型:較大的模型可以處理戰略規劃和複雜推理,而 Nemotron 3.5 Lightning 則負責重複性的執行步驟。NVIDIA 將此描述為一個「模型系統」,而非由單一模型負責每項任務。
速度是核心特性
NVIDIA 將推理速度作為 Nemotron 3.5 Lightning 的一項決定性特徵加以強調。該公司報告稱,在 PinchBench 上,該模型達到了 86% 的準確率,同時在相近準確率下完成 10,000 項任務的速度比 Qwen3.6 35B 快 30%。NVIDIA 還報告稱,Nemotron 3.5 Lightning 在 Artificial Analysis Intelligence Index 中達到了準確率-速度的帕累托前沿。
這些數據是 NVIDIA 自行報告的結果,而非獨立驗證。儘管如此,對吞吐量的強調反映了 AI 市場的發展方向。隨著 AI 進入生產環境,開發者越來越關心模型能多快、多高效地完成實際工作負載,而不僅僅是在單個基準測試問題上的表現。
推理效率為何重要
訓練大型 AI 模型因其所需的龐大計算資源而備受關注,但推理正成為 AI 經濟中同樣重要的一環。產業分析師估計,隨著模型從開發階段進入服務數十億查詢的實際生產環境,推理已佔 AI 計算總支出的顯著且不斷增長的份額。每次 AI 系統回應請求、生成程式碼、檢索資訊或完成自動化任務時,都會消耗計算資源。對於持續運作的 AI Agent 來說,這些成本會快速累積。
一個能夠更快產生回應同時需要較少活躍參數的模型,有可能減少給定工作負載所需的計算基礎設施。NVIDIA 的最新模型解決了一個實際問題:如何讓自主 AI 系統持續運作,而不會使每個單獨任務變得不必要地昂貴。
自訂化與開源權重 AI
NVIDIA 將 Nemotron 3.5 Lightning 定位為可自訂化的模型。開發者在寬鬆的 OpenMDW-1.1 授權結構下獲得模型的權重、訓練資料和方法,可針對特定應用進行調整。NVIDIA 表示,該模型可以透過 NVIDIA 的 NeMo 工具使用 LoRA 或全監督微調進行調優,開發者還可以使用強化學習和基於環境的評估。
此次發布也反映了 NVIDIA 持續推進開源權重 AI 的戰略。與其強制開發者僅透過專有 API 存取模型,開源權重模型提供了更多的部署控制權。組織可以在自己的基礎設施上運行模型、針對特定使用場景進行調整,並整合到現有的 AI 系統中——這對於處理敏感資訊的企業尤為重要。這一策略與更廣泛的產業趨勢一致:Meta 的 Llama 模型、阿里巴巴的 Qwen 系列、Mistral AI 的發布以及 Google 的 Gemma 系列都展現了對可下載、可修改 AI 模型的強烈需求。
支援本地與資料中心部署
根據 NVIDIA 的模型文件,Nemotron 3.5 Lightning 可以在單一 DGX Spark 系統或 H100 GPU 上的某些配置下運行。它還支援 NVIDIA Blackwell 硬體和 Hopper 世代 GPU,並透過支援的推理框架提供額外的部署選項。這種靈活性使該模型既適合在本地系統上實驗自主 Agent 的開發者,也適合營運大規模生產環境的企業。
混合架構
Nemotron 3.5 Lightning 並非完全依賴傳統的 Transformer 架構。NVIDIA 將其描述為結合了 Mamba-2、混合專家層和選定注意力層的混合系統。該架構旨在平衡計算效率與處理複雜序列的能力。Mamba 風格的組件可以減少序列處理過程中的某些記憶體需求,而 MoE 層使模型能夠在不為每個 Token 啟動所有參數的情況下擴展其總參數量。注意力層對於需要 Token 之間詳細關係的任務仍然至關重要。使用 Mamba-2 使 Nemotron 與少數採用狀態空間模型技術與 Transformer 並用的生產模型為伍,AI21 Labs 等公司和各研究團體都曾探索過這一方向。
上下文長度最高達 100 萬 Token
NVIDIA 的模型文件列出了對最高達 100 萬 Token 上下文長度的支援。大型上下文視窗對於需要處理大量文件、原始碼庫、日誌或長時間運行任務歷史的 AI Agent 非常有用。例如,一個處理大型軟體專案的 Agent 可能需要存取許多檔案和先前的互動記錄。更長的上下文可以減少反覆摘要或丟棄資訊的需要。這使得 Nemotron 3.5 Lightning 與 Google 的 Gemini 1.5 Pro 和 Meta 的 Llama 3.1 等模型處於同一範圍,這些模型也將上下文視窗擴展到了數十萬乃至百萬 Token。
來源:X 貼文
Nemotron 3.5 Lightning 加入不斷壯大的家族
此次最新發布擴展了已經相當豐富的 Nemotron 3 系列。NVIDIA 此前推出了多個為不同層級 AI 工作負載設計的模型,包括用於高效執行的較小模型和用於複雜推理及多 Agent 應用的較大系統。該公司的戰略日益基於專業化——NVIDIA 不再假設一個模型應該處理所有工作,而是在建構一個由不同優勢模型組成的集合。
Nemotron 3.5 Lightning 被定位於該範圍中高吞吐量執行的一側,這可能使其成為大型推理系統的補充,而非直接替代品。
NVIDIA 推出 NeMo Switchyard 實現模型路由
除了新模型之外,NVIDIA 還在推廣 NeMo Switchyard——一個旨在將任務路由到不同模型的程式庫。系統可以判斷特定任務是否需要強大的推理模型,或者較小、更快的模型是否就能完成。例如,複雜的規劃請求可以發送到前沿推理系統,而重複性的執行任務則可以交給 Nemotron 3.5 Lightning。NVIDIA 表示,Switchyard 允許開發者將 Lightning 與開源和閉源模型並列,並根據需求路由個別請求。
如果這種模型路由方式變得普及,AI 應用可能會越來越多地作為專業化模型的網絡運作。類似的路由概念已被 OpenAI 的模型系列和各種開源編排框架所探索。
AI Agent 的經濟學
AI Agent 的經濟學可能成為產業下一階段最重要的議題之一。聊天機器人可能只回應使用者一次,但自主 Agent 可能需要執行數百甚至數千次操作才能完成單一目標。如果開發者可以為常規執行使用較小的模型,並將昂貴的推理模型保留給困難的決策,AI 系統的總成本就有可能下降。NVIDIA 押注這種勞動分工將成為大規模 Agent 系統的標準架構。
程式開發是主要應用場景
軟體開發是 AI Agent 已經變得越來越活躍的領域之一。程式碼 Agent 可以檢查程式庫、撰寫程式、執行測試、識別錯誤並進行修正——這些工作流程涉及與工具的反覆互動。GitHub Copilot、Cursor 和 Cognition 的 Devin 等產品已經證明了 AI 輔助開發的需求。NVIDIA 的文件將程式開發和 Agent 工作負載列為模型的目標應用之一,包括軟體開發和工具使用場景。該公司還表示,模型的訓練資料涵蓋了程式開發、工具調用、結構化輸出和多步驟工作流程。
企業應用潛力可觀
企業也是 Nemotron 3.5 Lightning 的重要目標。公司正在嘗試將 AI Agent 用於客戶支援、內部研究、文件處理、IT 營運、軟體開發和工作流程自動化。這些應用中有許多涉及重複性步驟:客服 Agent 可能需要檢索帳戶資訊、驗證請求並更新記錄;IT Agent 可能需要執行命令並驗證所要求的變更是否成功。這些任務並不總是需要最深層的推理,但確實需要可靠性和速度。
NVIDIA 更廣泛的 AI 戰略
此次發布展示了 NVIDIA 的 AI 業務如何超越 GPU 擴展。該公司仍然是全球最重要的加速運算硬體供應商之一,但其戰略日益涵蓋建構在硬體之上的軟體和模型層。透過發布開源模型和開發工具,NVIDIA 可以鼓勵開發者建構最終在 NVIDIA 基礎設施上運行的 AI 系統。Nemotron 是將 NVIDIA 建立為全端 AI 平台的更廣泛努力的一部分——不僅與硬體競爭對手競爭,也與 AWS 和 Google Cloud 等提供自有 AI 軟體堆疊的雲端提供商競爭。
開源 AI 模型競爭加劇
NVIDIA 正在進入一個競爭激烈的開源模型市場。開發者可以從眾多科技公司和研究機構獲取模型,包括 Meta 的 Llama、阿里巴巴的 Qwen、Mistral AI、Google 的 Gemma 以及 Microsoft 支持的 OpenAI 的產品。競爭不再僅僅圍繞參數數量——開發者根據推理速度、準確率、上下文長度、授權方式、自訂化能力、硬體需求和工具使用能力來評估模型。一個能力稍弱但速度大幅提升的模型,對於生產環境中的 AI Agent 可能更為實用。這正是 Nemotron 3.5 Lightning 所瞄準的市場。
效能聲稱需要獨立評估
NVIDIA 聲稱的高速 Token 生成(達四倍)和 30% 更快的完成速度應結合背景來看待。基準測試結果可能因硬體、軟體配置、批次大小、序列長度和競爭模型的不同而有所差異。獨立開發者和研究人員最終將在模型部署到不同工作負載後提供更全面的評估。模型權重和文件的發布應有助於推動這些測試。
對 NVIDIA 投資者的意義
對於關注 NVDA 股票的投資者來說,Nemotron 3.5 Lightning 的發布不太可能像重大 GPU 產品發布那樣具有直接的財務影響。然而,它說明了一個重要的戰略趨勢:NVIDIA 正試圖使其技術堆疊在 AI 開發中變得越來越核心。如果開發者同時使用 NVIDIA 的模型、最佳化程式庫和硬體,該公司就能從 AI 生態系統的多個層面受益。
Coin Bureau 與更廣泛的 AI 討論
此次發布也引起了科技和加密貨幣相關社群媒體的關注,包括與 Coin Bureau 帳號相關的討論。本報告中的主要技術資訊來自 NVIDIA 自己的公告和模型文件。這些效能聲稱歸因於 NVIDIA,而非由 Coin Bureau 獨立驗證。
Nemotron 的下一步
Nemotron 3.5 Lightning 面臨的最重要考驗將是實際採用情況。開發者將判斷該模型能多容易地整合到現有的 Agent 框架中。企業將評估其可靠性和自訂化能力。研究人員將比較其與其他開源權重模型的效能。基礎設施提供商將判斷它在不同規模下的運作效率。
結論
NVIDIA 以 Nemotron 3.5 Lightning 擴展了其 Nemotron 3 系列,這是一款擁有約 30 億活躍參數的 300 億參數開源 MoE 模型,專為常駐 AI Agent 中的高吞吐量執行而設計。NVIDIA 表示,該模型的輸出速度可達同類模型的四倍,並以相近準確率比所引用的競爭模型快 30% 完成 10,000 項 Agent 任務——這些數據仍為廠商自行報告,應進行獨立評估。
該模型的架構結合了 Mamba-2、MoE 和注意力組件,支援最高達 100 萬 Token 的上下文長度。NVIDIA 在 OpenMDW-1.1 授權下發布權重和訓練資源,使開發者能夠使用 NeMo 工具進行微調和自訂化。
更廣泛的意義在於對效率的關注。隨著 AI Agent 變得更加自主並被期望執行數千項個別操作,NVIDIA 提出的解決方案是分配工作:大型推理模型處理複雜規劃,而像 Nemotron 3.5 Lightning 這樣較小的專業化模型則快速執行常規任務。這種由 NeMo Switchyard 支援的模型路由策略,可能成為企業 AI 架構的重要組成部分。