ニュース株式NVIDIA、AIエージェント向け30BオープンMoEモデル「Nemotron 3.5 Lightning」でNemotron 3ファミリーを拡張

NVIDIA、AIエージェント向け30BオープンMoEモデル「Nemotron 3.5 Lightning」でNemotron 3ファミリーを拡張

著者: Hokanews·

重要ポイント

  • Nemotron 3.5 Lightningは、総パラメータ300億のうち約30億のみをアクティブ化するMixture-of-Experts設計を採用している。
  • NVIDIAは、このモデルが複雑な推論だけでなく、常時稼働・低遅延のエージェント処理に最適化されていると説明している。
  • 同社は、同等精度で10,000件のタスクをQwen3.6 35Bより30%高速に完了し、同クラスの類似モデル比で最大4倍の出力速度を実現したと報告している。
  • NVIDIAは、モデルの重み、学習データ、レシピをOpenMDW-1.1ライセンスの下で公開し、NeMoツールによる微調整を可能にしている。
  • NVIDIAはまた、より大きな推論モデルとNemotron 3.5 Lightningのような小型実行モデルの間で作業を振り分けるNeMo Switchyardを導入した。
NVIDIA、AIエージェント向け30BオープンMoEモデル「Nemotron 3.5 Lightning」でNemotron 3ファミリーを拡張

NVIDIAは、AIエージェントの高頻度処理向けに特化した30億パラメータのオープンMixture-of-Experts(MoE)モデル「Nemotron 3.5 Lightning」の提供開始により、人工知能モデル群「Nemotron 3」ファミリーを拡張した。

この新モデルは、ツール呼び出し、データ処理、ソフトウェア操作、結果検証、異なるAIシステム間の通信などを継続的に処理する、拡大するAIアプリケーション群を対象としている。NVIDIAによると、Nemotron 3.5 Lightningは、同クラスの類似モデルと比べて最大4倍の出力速度を実現し、同程度の精度で大規模なエージェントタスクを最大30%速く完了できるという。

この発表は、NVIDIAの拡大するAI戦略にさらなる層を加える。NVIDIAは、AIシステムを動かすプロセッサを供給することだけに注力しているわけではなく、NVIDIAハードウェア上で企業がAIアプリケーションを構築・展開するのを支援するモデル、ソフトウェア、ツールの開発を強化している。これによりNVIDIAは、AMDやIntelといったチップメーカーだけでなく、オープンウェイトAI市場におけるMeta(Llama)、Alibaba(Qwen)、Mistral AI、Google(Gemma)などのモデル提供企業とも競合する立場にある。

NVIDIA、AIエージェントの次の段階を狙う

最新のNemotronモデルは、AIエージェントがテクノロジー業界全体で大きな焦点となる中で登場した。従来のAIアシスタントは通常、個別のプロンプトに応答するのに対し、エージェントは大きな目標を複数のアクションに分解し、外部ツールを使い、情報を取得し、コマンドを実行し、その結果を評価してから次へ進むことができる。OpenAI、Anthropic、Google、Microsoftを含む各社は、より高い自律性を持って動作するエージェント型AIが重要なフロンティアであると示している。

こうしたシステムでは、モデル呼び出しの回数が非常に多くなる。たとえばAIコーディングエージェントは、1つのタスクを完了するまでに、ファイルの確認、コマンド実行、エラー確認、コード修正、テスト実行を何度も繰り返す必要がある。各ステップごとに、必ずしも最も強力な推論モデルは必要ない。むしろ、反復作業を素早く効率的に実行できる小型モデルが望まれる場合がある。

NVIDIAがNemotron 3.5 Lightningで狙っているのはまさにこの市場だ。同社は、このモデルが最も複雑な推論作業だけに使うのではなく、高頻度・低遅延の実行に最適化されていると説明している。

30億アクティブパラメータを持つ300億パラメータモデル

Nemotron 3.5 Lightningの重要な技術的特徴の1つが、Mixture-of-Expertsアーキテクチャである。モデル全体のパラメータ数は300億だが、NVIDIAによれば、あるフォワードパスで実際にアクティブになるのは約30億パラメータにすぎない。これにより、モデルは大幅に大きなシステムと同等の容量を維持しつつ、各トークンに必要な計算量を抑えられる。MoEアーキテクチャは業界で広く採用が進んでおり、DeepSeek-V3、MistralのMixtral、xAIのGrokなども、推論計算を比例的に増やさずにパラメータ数を拡張する類似手法を採用している。

従来の密なモデルでは、基本的に全パラメータが各入力の処理に関与する。MoEモデルはこれとは異なり、ルーティングシステムが、特定のトークンやタスクの一部をどのエキスパートが担当するかを決定する。選択されたエキスパートのみが有効化されるため、計算量を抑えながら大きな総パラメータプールを維持できる。

NVIDIAは、この設計によりNemotron 3.5 Lightningが速度と効率が重要な高頻度ワークロードに適していると説明している。総パラメータ300億、アクティブパラメータ30億という構成は、Nemotron 3ファミリーの中では比較的小型に分類されるが、洗練されたエージェントワークフローを想定した能力は維持している。

常時稼働のAI向けに設計

「always-on AI agents」という概念は、この新モデルに対するNVIDIAの位置づけの中心にある。同社は、長時間稼働するエージェントの多くは、複雑な推論よりも比較的定型的な処理に時間を費やしていると主張する。そうした処理には、ツール呼び出し、出力の検証、情報の整形、ファイル取得、他モデルへのタスク委譲などが含まれる。

すべての処理に大型の最先端推論モデルを使うと、遅延と計算コストの両方が増加する可能性がある。NVIDIAのアプローチは、作業を複数のモデルに分担させることだ。より大きなモデルが戦略的計画や複雑な推論を担当し、Nemotron 3.5 Lightningが反復的な実行ステップを担う。NVIDIAはこれを、すべてのタスクを1つのモデルが担うのではなく、「モデルのシステム」と表現している。

速度が中心的な特徴

NVIDIAは、推論速度をNemotron 3.5 Lightningの定義的特徴の1つとして強調している。同社は、PinchBenchにおいて、このモデルがQwen3.6 35Bと同等の精度で10,000件のタスクを30%速く完了し、86%の精度を達成したと報告している。NVIDIAはまた、Nemotron 3.5 LightningがArtificial Analysis Intelligence Indexで精度と速度のパレートフロンティアに達していると述べている。

これらの数値はNVIDIAの報告結果であり、独立した確認ではない。それでも、スループットを重視する姿勢はAI市場の方向性を示している。AIが本番環境に移行するにつれ、開発者は個別ベンチマークでの性能だけでなく、実際のワークロードをどれだけ速く効率的に処理できるかを重視するようになっている。

推論効率が重要な理由

大規模AIモデルの学習は、膨大な計算資源を必要とするため大きな注目を集めるが、推論もAI経済において同様に重要な要素になりつつある。AIシステムがリクエストに応答し、コードを生成し、情報を取得し、自動化タスクを完了するたびに、計算資源が消費される。常時稼働するAIエージェントでは、そのコストが急速に積み上がる可能性がある。

より少ないアクティブパラメータで、より速く応答を生成できるモデルは、特定のワークロードに必要な計算インフラを削減できる可能性がある。NVIDIAの最新モデルは、各タスクを不必要に高コストにすることなく、自律型AIシステムを継続的に稼働させる方法という実務的な課題に対応している。

カスタマイズ性も大きな訴求点

NVIDIAはNemotron 3.5 Lightningをカスタマイズ可能なモデルとしても位置付けている。同社によると、開発者はOpenMDW-1.1の許容的なライセンス構造の下で、モデルの重み、学習データ、レシピを受け取り、特定のアプリケーションに合わせて調整できる。NVIDIAは、NeMoツールを通じてLoRAや完全な教師ありファインチューニングで微調整できるほか、強化学習や環境ベースの評価も利用できるとしている。

この発表は、NVIDIAがオープンウェイトAIへの取り組みを継続していることを示している。プロプライエタリAPI経由でしかモデルにアクセスできないようにするのではなく、オープンウェイトモデルは展開に関するコントロールをより多く提供する。組織は自社インフラ上でモデルを実行し、特定の用途に合わせて調整し、既存のAIシステムへ統合できる。特に機密情報を扱う企業にとって、このアプローチは重要になりうる。MetaのLlama、AlibabaのQwenシリーズ、Mistral AIの各リリース、GoogleのGemmaラインなども、ダウンロード可能で改変可能なAIモデルへの強い需要を示している。

ローカル環境とデータセンター展開に対応

NVIDIAのモデル文書によると、Nemotron 3.5 Lightningは、特定の構成下で単一のDGX SparkシステムまたはH100 GPU上で動作できる。また、NVIDIA BlackwellハードウェアやHopper世代GPUでもサポートされ、対応する推論フレームワークを通じた追加の展開オプションも用意されている。この柔軟性により、ローカルシステム上で自律型エージェントを試す開発者にも、大規模な本番環境を運用する企業にも適したモデルとなっている。

ハイブリッドアーキテクチャ

Nemotron 3.5 Lightningは、従来型のTransformerアーキテクチャだけに依存していない。NVIDIAはこれを、Mamba-2、Mixture-of-Experts層、選択的なAttention層を組み合わせたハイブリッドシステムと説明している。このアーキテクチャは、計算効率と複雑な系列処理能力の両立を狙ったものだ。Mamba系の構成要素は系列処理中の一部メモリ要件を削減でき、MoE層は各トークンで全パラメータを有効化することなく総パラメータ数を拡張できる。一方で、Attention層はトークン間の詳細な関係を扱うタスクで依然として重要である。Mamba-2の採用により、NemotronはTransformerと並行してstate-space model技術を採用する比較的小規模な実運用モデル群に加わることになる。このアプローチは、AI21 Labsやさまざまな研究グループによっても検討されている。

コンテキスト長は最大100万トークン

NVIDIAのモデル文書によると、このモデルは最大100万トークンのコンテキスト長に対応している。大きなコンテキストウィンドウは、大量の文書、ソースコードリポジトリ、ログ、長期にわたるタスク履歴を処理する必要があるAIエージェントに有用だ。たとえば大規模なソフトウェアプロジェクトに取り組むエージェントは、多くのファイルや過去のやり取りにアクセスする必要がある。より長いコンテキストは、情報を何度も要約したり切り捨てたりする必要を減らせる。

ただし、大きなコンテキストウィンドウが自動的にすべてのアプリケーションに同じ恩恵をもたらすわけではない。実際の性能は、ワークロード、推論構成、ハードウェアに左右される。それでも、この能力は、長く複雑なタスク全体で動作するよう設計されたAIシステムにNVIDIAが注力していることを示している。

Source: X投稿

Nemotron 3.5 Lightningが拡大するファミリーに加わる

今回のリリースにより、既存のNemotron 3ファミリーがさらに拡張された。NVIDIAは以前にも、効率的な実行向けの小型モデルや、複雑な推論やマルチエージェント用途向けの大型システムなど、異なるレベルのAIワークロード向けに複数のモデルを導入している。同社の戦略はますます特化型になっており、1つのモデルにすべての仕事を任せるのではなく、異なる強みを持つモデル群を構築している。

Nemotron 3.5 Lightningは、そのスペクトラムの中でも高頻度実行側に位置づけられており、大型推論システムの直接的な代替というより、補完的な存在になりうる。

NVIDIA、NeMo Switchyardでモデルルーティングを導入

NVIDIAは新モデルと同時に、タスクを異なるモデルへ振り分けるためのライブラリ「NeMo Switchyard」も推進している。この仕組みは比較的シンプルで、あるタスクに強力な推論モデルが必要か、それとも小型で高速なモデルで十分かをシステムが判断できる。たとえば、複雑な計画の依頼は最先端の推論システムに送り、反復的な実行タスクはNemotron 3.5 Lightningに任せることができる。NVIDIAによると、Switchyardを使えば、開発者はLightningをオープンモデルやクローズドモデルと並べて公開し、要件に応じて個別リクエストを振り分けられる。

このモデルルーティング手法が広く普及すれば、AIアプリケーションは専門化したモデル群のネットワークとして動作するようになる可能性がある。

AIエージェントの経済性

AIエージェントの経済性は、業界の次の段階で最も重要な論点の1つになる可能性がある。チャットボットは1回ユーザーに応答するだけかもしれないが、自律型エージェントは1つの目標を達成するために数百、数千もの操作を行うことがある。定型的な実行には小型モデルを使い、難しい判断には高コストな推論モデルを温存できれば、AIシステム全体のコストは下がる可能性がある。NVIDIAは、この役割分担が大規模なエージェント型システムの標準アーキテクチャになると見込んでいる。

コーディングは主要なユースケース

ソフトウェア開発は、AIエージェントの活用がすでに加速している分野の1つだ。コーディングエージェントは、リポジトリの調査、プログラム作成、テスト実行、エラー特定、修正を行える。こうしたワークフローはツールとの反復的なやり取りを伴うため、迅速な実行に最適化されたモデルは、コーディングエージェントの速度に直接影響しうる。NVIDIAの文書では、ソフトウェア開発やツール利用のシナリオを含むコーディングおよびエージェント型ワークロードが想定用途として挙げられている。同社はまた、このモデルがコーディング、ツール呼び出し、構造化出力、マルチステップワークフローに関するデータを用いて学習されたとしている。

企業向け用途も大きい可能性

Nemotron 3.5 Lightningの主要ターゲットは企業でもある。企業は、カスタマーサポート、社内調査、文書処理、IT運用、ソフトウェア開発、ワークフロー自動化向けにAIエージェントを試している。こうした用途の多くは反復的なステップを含む。たとえば、カスタマーサービスエージェントは口座情報を取得し、リクエストを検証し、記録を更新する。ITエージェントはコマンドを実行し、要求された変更が成功したかを確認する。こうしたタスクに、常に最深の推論が必要とは限らないが、信頼性と速度は必要である。

NVIDIAのより広いAI戦略

今回の発表は、NVIDIAのAI事業がGPUの枠を超えて拡大していることを示している。同社は依然として、世界で最も重要なアクセラレーテッド・コンピューティング・ハードウェアの供給企業の1つだが、その戦略にはハードウェア上に構築されるソフトウェア層やモデル層がますます含まれている。オープンモデルや開発ツールを公開することで、NVIDIAは開発者にNVIDIAインフラ上で動作するAIシステムの構築を促すことができる。Nemotronは、NVIDIAをフルスタックAIプラットフォームとして確立するための広範な取り組みの一部であり、自社のAIソフトウェアスタックを提供するAWSやGoogle Cloudのようなクラウド事業者とも競争する構図となる。

オープンAIモデル競争は激化

NVIDIAは、非常に競争の激しいオープンモデル市場に参入している。開発者は、MetaのLlama、AlibabaのQwen、Mistral AI、GoogleのGemma、Microsoft支援のOpenAIの提供モデルなど、多くの技術企業や研究機関のモデルを利用できる。競争はもはや単なるパラメータ数の比較ではなく、推論速度、精度、コンテキスト長、ライセンス、カスタマイズ性、ハードウェア要件、ツール利用能力などで評価される。やや能力は劣っていても大幅に高速なモデルのほうが、本番環境のAIエージェントでは有用な場合がある。Nemotron 3.5 Lightningが狙っているのは、まさにこの市場だ。

性能主張には独立検証が必要

NVIDIAが主張する最大4倍のトークン生成速度や30%高速な完了時間は重要だが、文脈を踏まえて見るべきだ。ベンチマーク結果は、ハードウェア、ソフトウェア構成、バッチサイズ、系列長、競合モデルによって変動しうる。独立した開発者や研究者が、さまざまなワークロードで実運用されるにつれ、より広い評価を示していくことになる。モデルの重みとドキュメントが公開されることで、その検証はしやすくなるはずだ。

NVIDIA投資家にとって何を意味するか

NVDA株を注視する投資家にとって、Nemotron 3.5 Lightningの発表は、大型GPU製品の発表ほど即時の財務的影響を持つ可能性は高くない。しかし、これは重要な戦略トレンドを示している。NVIDIAは、自社のテクノロジースタックをAI開発の中心に据えようとしている。開発者がNVIDIAのモデル、最適化ライブラリ、ハードウェアを組み合わせて使えば、同社はAIエコシステムの複数層から恩恵を受けられる。

Coin Bureauと広がるAIの議論

この発表は、Coin Bureauアカウントに関連する議論を含め、テクノロジーおよび暗号資産関連のソーシャルメディアでも注目を集めた。ただし、本稿の主要な技術情報はNVIDIA自身の発表とモデル文書に基づいている。性能主張については、Coin Bureauによる独立検証としてではなく、NVIDIAの主張として扱っている。

Nemotronの次の展開

Nemotron 3.5 Lightningにとって最も重要な試験は、実世界での採用だ。開発者は既存のエージェントフレームワークにどれだけ容易に統合できるかを判断する。企業は信頼性とカスタマイズ能力を評価する。研究者は他のオープンウェイトモデルと性能を比較する。そしてインフラ提供者は、異なる規模でどれだけ効率的に運用できるかを判断する。

もし開発者が、このモデルが高い精度を維持しながら大量の定型エージェントタスクを安定して処理できると評価すれば、NVIDIAは新たに強力なコンポーネントを新興のエージェント経済に提供することになる。

大局的な見方

Nemotron 3.5 Lightningのリリースは、人工知能のより広範な変化を反映している。AIは、単に質問に答えるシステムから、仕事を実行するシステムへと移行している。この移行には、継続的に動作し、ソフトウェアツールと連携し、大量の個別アクションを処理できるモデルが必要になる。最も強力な推論モデルが、そうしたタスクに常に最適とは限らない。速度、効率、カスタマイズ性のほうが重要になる場合もある。

NVIDIAは、その考え方を中心にNemotron 3.5 Lightningを位置づけている。このモデルは、大きな総パラメータプール、疎なアクティベーション、ハイブリッドアーキテクチャ、長いコンテキスト対応、カスタマイズ用ツールを組み合わせている。その目的は、必ずしも最大級のAIモデルを置き換えることではない。むしろ、それらと並行して動作するよう設計されている。

要点

NVIDIAは、約30億のアクティブパラメータを持つ300億パラメータのオープンMoEモデル「Nemotron 3.5 Lightning」でNemotron 3ファミリーを拡張した。

このモデルは、ツール呼び出し、コーディングワークフロー、結果検証、その他の反復タスクを含む、常時稼働のAIエージェントにおける高頻度実行向けに特化して設計されている。

NVIDIAによれば、Nemotron 3.5 Lightningは同等モデルの最大4倍の出力速度を達成し、同程度の精度で10,000件のエージェントタスクを、引用された競合モデルより30%速く完了できるという。これらの数値はベンダー報告の性能主張であり、異なるハードウェアやワークロードで独立に評価されるべきだ。

このモデルは、Mamba-2、MoE、Attentionコンポーネントを組み合わせたアーキテクチャを採用し、最大100万トークンのコンテキスト長をサポートする。また、NVIDIAはOpenMDW-1.1ライセンスの下で重みと学習リソースを公開し、開発者がNeMoツールを使って微調整やカスタマイズを行えるようにしている。

発表のより大きな意義は、効率性への注目にある。AIエージェントがより自律的になり、何千もの個別操作を実行するようになるにつれ、NVIDIAの提案は作業の分担だ。大型の推論モデルが複雑な計画を担い、小型の特化モデルであるNemotron 3.5 Lightningが定型作業を素早く実行する。NeMo Switchyardに支えられたこのモデルルーティング戦略は、企業向けAIアーキテクチャの重要な要素になる可能性がある。