ActualitésActionsNVIDIA élargit la famille Nemotron 3 avec Nemotron 3.5 Lightning, un modèle MoE ouvert de 30 milliards de paramètres pour les charges de travail d’agents IA

NVIDIA élargit la famille Nemotron 3 avec Nemotron 3.5 Lightning, un modèle MoE ouvert de 30 milliards de paramètres pour les charges de travail d’agents IA

Auteur: Hokanews·

Points clés

  • Nemotron 3.5 Lightning utilise une conception Mixture-of-Experts avec environ 3 milliards de paramètres actifs sur 30 milliards au total.
  • NVIDIA indique que le modèle est optimisé pour des charges de travail d’agents always-on à faible latence plutôt que pour les seules tâches de raisonnement complexe.
  • L’entreprise affirme que le modèle était 30 % plus rapide que Qwen3.6 35B sur 10 000 tâches à précision similaire et qu’il pouvait atteindre jusqu’à quatre fois la vitesse de sortie de modèles comparables de sa catégorie.
  • NVIDIA publie les poids du modèle, les données d’entraînement et les recettes sous licence OpenMDW-1.1, avec prise en charge du fine-tuning via les outils NeMo.
  • NVIDIA a également introduit NeMo Switchyard pour répartir le travail entre de plus grands modèles de raisonnement et des modèles d’exécution plus petits comme Nemotron 3.5 Lightning.
NVIDIA élargit la famille Nemotron 3 avec Nemotron 3.5 Lightning, un modèle MoE ouvert de 30 milliards de paramètres pour les charges de travail d’agents IA

NVIDIA a élargi sa famille Nemotron 3 de modèles d’intelligence artificielle avec la sortie de Nemotron 3.5 Lightning, un modèle ouvert Mixture-of-Experts (MoE) de 30 milliards de paramètres conçu spécifiquement pour les charges de travail d’agents IA à grand volume.

Le nouveau modèle vise une catégorie croissante d’applications d’IA qui fonctionnent en continu, en prenant en charge des tâches telles que les appels d’outils, le traitement de données, les opérations logicielles, la validation des résultats et la communication entre différents systèmes d’IA. NVIDIA indique que Nemotron 3.5 Lightning peut offrir une vitesse de sortie jusqu’à quatre fois supérieure à celle de modèles comparables de sa catégorie, tout en exécutant de grands lots de tâches agentiques jusqu’à 30 % plus vite, à des niveaux de précision similaires.

Cette annonce ajoute une nouvelle dimension à la stratégie IA en expansion de NVIDIA. L’entreprise ne se limite plus à fournir les processeurs utilisés pour faire fonctionner les systèmes d’IA ; elle développe de plus en plus des modèles, des logiciels et des outils conçus pour aider les entreprises à créer et déployer des applications d’IA sur le matériel NVIDIA. Cela positionne NVIDIA non seulement face à des fabricants de puces comme AMD et Intel, mais aussi face à des fournisseurs de modèles tels que Meta (Llama), Alibaba (Qwen), Mistral AI et Google (Gemma) sur le marché de l’IA open-weight.

NVIDIA cible la prochaine étape des agents IA

Le dernier modèle Nemotron arrive alors que les agents IA deviennent un axe majeur dans l’industrie technologique. Les assistants IA traditionnels répondent généralement à des requêtes individuelles, tandis qu’un agent peut décomposer un objectif plus vaste en plusieurs actions, utiliser des outils externes, récupérer des informations, exécuter des commandes et évaluer les résultats avant de poursuivre. Des entreprises comme OpenAI, Anthropic, Google et Microsoft ont toutes indiqué que l’IA agentique — des systèmes agissant avec davantage d’autonomie — constitue une frontière clé.

Ces systèmes peuvent générer un très grand nombre d’appels de modèle. Un agent de codage IA, par exemple, peut devoir inspecter des fichiers, exécuter des commandes, examiner des erreurs, modifier du code et lancer des tests de manière répétée avant d’achever une seule tâche. Chaque étape individuelle ne nécessite pas forcément le modèle de raisonnement le plus puissant disponible ; les développeurs peuvent plutôt préférer un modèle plus petit capable d’exécuter des tâches répétitives rapidement et efficacement.

C’est ce marché que NVIDIA vise avec Nemotron 3.5 Lightning. L’entreprise indique que le modèle est optimisé pour une exécution à haut volume et à faible latence, plutôt que pour être utilisé exclusivement sur les charges de raisonnement les plus complexes.

Un modèle de 30 milliards de paramètres avec 3 milliards de paramètres actifs

Une caractéristique technique clé de Nemotron 3.5 Lightning est son architecture Mixture-of-Experts. Bien que le modèle contienne 30 milliards de paramètres au total, NVIDIA précise qu’environ 3 milliards de paramètres seulement sont actifs lors d’un passage avant donné. Cela permet au modèle de conserver la capacité d’un système sensiblement plus grand tout en réduisant la quantité de calcul requise pour chaque jeton. Les architectures MoE ont gagné du terrain dans l’industrie, avec des modèles comme DeepSeek-V3, Mixtral de Mistral et Grok de xAI adoptant des approches similaires pour augmenter le nombre de paramètres sans accroître proportionnellement le calcul d’inférence.

Dans un modèle dense traditionnel, l’ensemble des paramètres participe essentiellement au traitement de chaque entrée. Un modèle MoE fonctionne différemment : un système de routage détermine quels experts doivent traiter un jeton particulier ou une portion de tâche. Seuls certains experts sont activés, ce qui permet de réduire le calcul tout en conservant un vaste réservoir global de paramètres.

NVIDIA indique que cette conception rend Nemotron 3.5 Lightning adapté aux charges de travail à grand volume où la vitesse et l’efficacité sont essentielles. Avec 30 milliards de paramètres totaux et 3 milliards de paramètres actifs, il figure parmi les membres les plus petits de la famille Nemotron 3 tout en conservant des capacités destinées à des flux de travail agentiques sophistiqués.

Conçu pour une IA toujours active

Le concept d’« agents IA always-on » est central dans la position de ce nouveau modèle par NVIDIA. L’entreprise soutient que les agents de longue durée passent une grande partie de leur temps à effectuer des opérations relativement routinières plutôt que du raisonnement complexe. Ces opérations peuvent inclure des appels d’outils, la validation des résultats, la mise en forme d’informations, la récupération de fichiers et la délégation de tâches à d’autres modèles.

Faire tourner un grand modèle de raisonnement de pointe pour chaque opération individuelle pourrait augmenter à la fois la latence et les coûts de calcul. L’approche de NVIDIA consiste à répartir la charge de travail entre différents modèles : un modèle plus grand peut gérer la planification stratégique et le raisonnement complexe, tandis que Nemotron 3.5 Lightning prend en charge les étapes d’exécution répétitives. NVIDIA décrit cela comme un « système de modèles » plutôt que comme un modèle unique responsable de chaque tâche.

La vitesse est une caractéristique centrale

NVIDIA met en avant la vitesse d’inférence comme l’une des caractéristiques déterminantes de Nemotron 3.5 Lightning. L’entreprise indique que, sur PinchBench, le modèle a atteint une précision de 86 % tout en accomplissant 10 000 tâches 30 % plus rapidement que Qwen3.6 35B à précision similaire. NVIDIA rapporte également que Nemotron 3.5 Lightning atteint la frontière de Pareto précision-vitesse dans l’Artificial Analysis Intelligence Index.

Ces chiffres sont les résultats rapportés par NVIDIA et non une confirmation indépendante. Néanmoins, l’accent mis sur le débit reflète l’orientation du marché de l’IA. À mesure que l’IA passe en environnement de production, les développeurs se soucient de plus en plus de la rapidité et de l’efficacité avec lesquelles les modèles peuvent exécuter des charges réelles, plutôt que de leur seule performance sur des questions de benchmark isolées.

Pourquoi l’efficacité d’inférence est importante

L’entraînement de grands modèles d’IA attire une attention considérable en raison des ressources de calcul massives requises, mais l’inférence devient une partie tout aussi importante de l’économie de l’IA. Des analystes du secteur ont estimé que l’inférence représente déjà une part importante et croissante des dépenses totales de calcul IA, à mesure que les modèles passent du développement à la production en ligne au service de milliards de requêtes. Chaque fois qu’un système d’IA répond à une demande, génère du code, récupère des informations ou exécute une tâche automatisée, des ressources de calcul sont consommées. Pour un agent IA fonctionnant en continu, ces coûts peuvent s’accumuler rapidement.

Un modèle qui produit des réponses plus vite tout en nécessitant moins de paramètres actifs peut potentiellement réduire l’infrastructure de calcul requise pour une charge donnée. Le dernier modèle de NVIDIA répond à un problème pratique : comment faire fonctionner en continu des systèmes d’IA autonomes sans rendre chaque tâche individuelle inutilement coûteuse.

La personnalisation et l’IA open-weight

NVIDIA positionne aussi Nemotron 3.5 Lightning comme un modèle personnalisable. Les développeurs reçoivent les poids du modèle, les données d’entraînement et les recettes sous une structure de licence permissive OpenMDW-1.1, leur permettant d’adapter le modèle à des applications spécifiques. NVIDIA indique que le modèle peut être affiné avec LoRA ou par un fine-tuning supervisé complet via les outils NeMo de NVIDIA, et que les développeurs peuvent également utiliser l’apprentissage par renforcement et des évaluations fondées sur l’environnement.

Cette sortie reflète la poursuite de l’offensive de NVIDIA dans l’IA open-weight. Au lieu d’obliger les développeurs à accéder à un modèle exclusivement via une API propriétaire, les modèles open-weight offrent davantage de contrôle sur le déploiement. Les organisations peuvent exécuter des modèles sur leur propre infrastructure, les adapter à des cas d’usage spécifiques et les intégrer à des systèmes d’IA existants — une approche particulièrement importante pour les entreprises traitant des informations sensibles. Cette approche s’inscrit dans une tendance plus large du secteur : les modèles Llama de Meta, la série Qwen d’Alibaba, les publications de Mistral AI et la gamme Gemma de Google ont tous montré une forte demande pour des modèles d’IA téléchargeables et modifiables.

Conçu pour un déploiement local et en centre de données

Selon la documentation modèle de NVIDIA, Nemotron 3.5 Lightning peut s’exécuter sur un seul système DGX Spark ou sur un GPU H100 dans certaines configurations. Il est également pris en charge sur le matériel Blackwell de NVIDIA et sur les GPU de génération Hopper, avec des options de déploiement supplémentaires disponibles via des frameworks d’inférence pris en charge. Cette flexibilité rend le modèle adapté aux développeurs qui expérimentent des agents autonomes sur des systèmes locaux ainsi qu’aux entreprises opérant de grands environnements de production.

Une architecture hybride

Nemotron 3.5 Lightning ne repose pas exclusivement sur une architecture Transformer conventionnelle. NVIDIA le décrit comme un système hybride combinant Mamba-2, des couches Mixture-of-Experts et certaines couches d’attention. L’architecture vise à équilibrer l’efficacité de calcul avec la capacité à traiter des séquences complexes. Les composants de type Mamba peuvent réduire certains besoins en mémoire pendant le traitement des séquences, tandis que les couches MoE permettent au modèle de faire évoluer son nombre total de paramètres sans activer tous les paramètres pour chaque jeton. Les couches d’attention restent importantes pour les tâches nécessitant des relations détaillées entre les jetons. L’utilisation de Mamba-2 place Nemotron parmi un groupe relativement restreint de modèles de production adoptant des techniques de modèles d’état en plus des Transformers, une approche explorée par des entreprises comme AI21 Labs et divers groupes de recherche.

La longueur de contexte atteint jusqu’à 1 million de jetons

La documentation modèle de NVIDIA indique une prise en charge de longueurs de contexte allant jusqu’à 1 million de jetons. Une grande fenêtre de contexte peut être utile pour les agents IA qui doivent traiter de vastes documents, des dépôts de code source, des journaux ou des historiques de tâches de longue durée. Un agent travaillant sur un grand projet logiciel, par exemple, peut avoir besoin d’accéder à de nombreux fichiers et à des interactions précédentes. Un contexte plus long peut réduire la nécessité de résumer ou d’écarter répétitivement des informations. Cela place Nemotron 3.5 Lightning dans la même gamme que des modèles comme Gemini 1.5 Pro de Google et Llama 3.1 de Meta, qui ont eux aussi porté les fenêtres de contexte à des centaines de milliers ou des millions de jetons.

Source : publication X

Nemotron 3.5 Lightning rejoint une famille en expansion

Cette dernière sortie élargit une famille Nemotron 3 déjà vaste. NVIDIA avait auparavant présenté plusieurs modèles conçus pour différents niveaux de charge de travail IA, y compris des modèles plus petits pour une exécution efficace et des systèmes plus larges pour le raisonnement complexe et les applications multi-agents. La stratégie de l’entreprise repose de plus en plus sur la spécialisation : au lieu de supposer qu’un seul modèle doit tout faire, NVIDIA construit un ensemble de modèles aux forces différentes.

Nemotron 3.5 Lightning est positionné du côté exécution à haut volume de ce spectre, ce qui pourrait en faire un complément aux systèmes de raisonnement plus grands plutôt qu’un remplacement direct.

NVIDIA introduit le routage de modèles avec NeMo Switchyard

Parallèlement au nouveau modèle, NVIDIA met en avant NeMo Switchyard, une bibliothèque conçue pour orienter les tâches vers différents modèles. Un système peut déterminer si une tâche particulière nécessite un modèle de raisonnement puissant ou si un modèle plus petit et plus rapide peut la réaliser. Par exemple, une demande de planification complexe pourrait être envoyée à un système de raisonnement de pointe, tandis que des tâches d’exécution répétitives pourraient être confiées à Nemotron 3.5 Lightning. NVIDIA indique que Switchyard permet aux développeurs d’exposer Lightning aux côtés de modèles ouverts et fermés, et d’orienter les requêtes individuelles selon leurs besoins.

Si cette approche de routage des modèles se généralise, les applications d’IA pourraient de plus en plus fonctionner comme des réseaux de modèles spécialisés. Des concepts de routage similaires ont été explorés par des plateformes comme la famille de modèles d’OpenAI et divers frameworks d’orchestration open source.

L’économie des agents IA

L’économie des agents IA pourrait devenir l’un des sujets les plus importants de la prochaine phase de l’industrie. Un chatbot peut répondre une fois à un utilisateur, mais un agent autonome peut effectuer des centaines ou des milliers d’opérations pour atteindre un seul objectif. Si un développeur peut utiliser un modèle plus petit pour l’exécution courante et réserver les modèles de raisonnement coûteux aux décisions difficiles, le coût total d’un système d’IA pourrait potentiellement baisser. NVIDIA parie que cette division du travail deviendra une architecture standard pour les systèmes agentiques à grande échelle.

Le codage est un cas d’usage majeur

Le développement logiciel est l’un des domaines où les agents IA deviennent déjà de plus en plus actifs. Les agents de codage peuvent inspecter des dépôts, écrire des programmes, exécuter des tests, identifier des erreurs et effectuer des corrections — des flux de travail impliquant des interactions répétées avec des outils. Des produits comme GitHub Copilot, Cursor et Devin de Cognition ont démontré la demande pour le développement assisté par IA. La documentation de NVIDIA cite le codage et les charges agentiques parmi les applications visées du modèle, y compris les scénarios de développement logiciel et d’utilisation d’outils. L’entreprise indique également que le modèle a été entraîné avec des données impliquant le codage, les appels d’outils, les sorties structurées et les flux de travail multi-étapes.

Les applications d’entreprise pourraient être importantes

Les entreprises constituent également une cible majeure pour Nemotron 3.5 Lightning. Elles expérimentent des agents IA pour le support client, la recherche interne, le traitement de documents, les opérations informatiques, le développement logiciel et l’automatisation des flux de travail. Beaucoup de ces applications impliquent des étapes répétitives : un agent de service client peut récupérer des informations de compte, valider une demande et mettre à jour des enregistrements ; un agent informatique peut exécuter des commandes et vérifier si la modification demandée a réussi. Ces tâches ne nécessitent pas toujours le raisonnement le plus profond possible, mais elles exigent fiabilité et rapidité.

La stratégie IA plus large de NVIDIA

Ce lancement montre comment l’activité IA de NVIDIA s’étend au-delà des GPU. L’entreprise reste l’un des fournisseurs les plus importants au monde de matériel de calcul accéléré, mais sa stratégie inclut de plus en plus les couches logicielles et modèles construites au-dessus de ce matériel. En publiant des modèles ouverts et des outils de développement, NVIDIA peut encourager les développeurs à construire des systèmes d’IA qui fonctionneront finalement sur l’infrastructure NVIDIA. Nemotron s’inscrit dans un effort plus large visant à faire de NVIDIA une plateforme IA full-stack, en concurrence non seulement avec les rivaux du matériel mais aussi avec des fournisseurs cloud comme AWS et Google Cloud qui proposent leurs propres piles logicielles IA.

La concurrence sur les modèles IA ouverts s’intensifie

NVIDIA entre sur un marché des modèles ouverts hautement concurrentiel. Les développeurs ont accès à des modèles provenant de nombreuses entreprises technologiques et organisations de recherche, dont Llama de Meta, Qwen d’Alibaba, Gemma de Google et les offres d’OpenAI soutenue par Microsoft. La concurrence ne porte plus seulement sur le nombre de paramètres : les développeurs évaluent désormais les modèles selon la vitesse d’inférence, la précision, la longueur de contexte, la licence, la personnalisation, les exigences matérielles et les capacités d’utilisation des outils. Un modèle légèrement moins capable mais nettement plus rapide peut être plus utile pour un agent IA en production. C’est précisément ce marché que vise Nemotron 3.5 Lightning.

Les affirmations de performance nécessitent une évaluation indépendante

Les affirmations de NVIDIA selon lesquelles la génération de jetons serait jusqu’à quatre fois plus rapide et l’achèvement 30 % plus rapide doivent être replacées dans leur contexte. Les résultats de benchmark peuvent varier selon le matériel, la configuration logicielle, la taille des lots, la longueur de séquence et les modèles concurrents. Les développeurs et chercheurs indépendants fourniront en définitive une vision plus large à mesure que le modèle sera déployé sur différentes charges de travail. La publication des poids et de la documentation du modèle devrait faciliter ces tests.

Ce que cela signifie pour les investisseurs de NVIDIA

Pour les investisseurs qui suivent l’action NVDA, le lancement de Nemotron 3.5 Lightning n’a probablement pas la même portée financière immédiate qu’une annonce majeure de produit GPU. Il illustre toutefois une tendance stratégique importante : NVIDIA cherche à rendre sa pile technologique de plus en plus centrale dans le développement de l’IA. Si les développeurs utilisent ensemble les modèles, les bibliothèques d’optimisation et le matériel NVIDIA, l’entreprise peut bénéficier de plusieurs couches de l’écosystème IA.

Coin Bureau et la conversation IA plus large

Cette sortie a également suscité de l’attention au sein des communautés sociales axées sur la technologie et la cryptomonnaie, notamment des discussions associées au compte Coin Bureau. Les informations techniques principales de ce rapport proviennent de l’annonce propre à NVIDIA et de la documentation du modèle. Les affirmations de performance sont attribuées à NVIDIA et non présentées comme vérifiées indépendamment par Coin Bureau.

La suite pour Nemotron

Le test le plus important pour Nemotron 3.5 Lightning sera son adoption dans le monde réel. Les développeurs détermineront à quel point le modèle peut être intégré facilement dans des frameworks d’agents existants. Les entreprises évalueront sa fiabilité et ses capacités de personnalisation. Les chercheurs compareront ses performances à celles d’autres modèles open-weight. Les fournisseurs d’infrastructure détermineront à quel point il peut fonctionner efficacement à différentes échelles.

Conclusion

NVIDIA a élargi sa famille Nemotron 3 avec Nemotron 3.5 Lightning, un modèle MoE ouvert de 30 milliards de paramètres avec environ 3 milliards de paramètres actifs, conçu pour une exécution à grand volume dans des agents IA always-on. NVIDIA indique que le modèle peut atteindre une vitesse de sortie jusqu’à quatre fois supérieure à celle de modèles comparables et accomplir 10 000 tâches agentiques 30 % plus vite qu’un modèle concurrent cité, à précision similaire — des chiffres qui restent fournis par le vendeur et doivent être évalués indépendamment.

L’architecture du modèle combine des composants Mamba-2, MoE et d’attention, avec une prise en charge de longueurs de contexte allant jusqu’à 1 million de jetons. NVIDIA publie les poids et les ressources d’entraînement sous licence OpenMDW-1.1, permettant aux développeurs d’affiner et de personnaliser le modèle à l’aide des outils NeMo.

L’importance plus large réside dans l’accent mis sur l’efficacité. À mesure que les agents IA deviennent plus autonomes et sont censés effectuer des milliers d’opérations individuelles, la solution proposée par NVIDIA consiste à répartir le travail : les grands modèles de raisonnement gèrent la planification complexe tandis que des modèles spécialisés plus petits comme Nemotron 3.5 Lightning exécutent rapidement les tâches routinières. Cette stratégie de routage des modèles, soutenue par NeMo Switchyard, pourrait devenir une partie importante de l’architecture IA d’entreprise.