NVIDIA lance Nemotron 3.5 Lightning et NeMo Switchyard pour une IA agentique plus intelligente et plus efficace
Points clés
- •Nemotron 3.5 Lightning est un modèle ouvert entièrement personnalisable de 30 milliards de paramètres, de type mixture-of-experts, conçu pour des tâches spécialisées à grand volume dans les flux de travail d’IA agentique.
- •NVIDIA indique que Nemotron 3.5 Lightning offre une vitesse de sortie jusqu’à 4x supérieure et une exécution 30% plus rapide des tâches agentiques par rapport aux autres modèles de sa catégorie.
- •NeMo Switchyard est une bibliothèque de routage open source qui dirige automatiquement chaque prompt vers le modèle le plus capable et le plus rentable, réduisant le coût d’exécution des tâches à environ un tiers de celui d’un seul modèle frontier.
- •Le modèle prend en charge un déploiement flexible sur systèmes locaux, appareils en périphérie, stations de travail, centres de données et environnements cloud, permettant aux organisations d’équilibrer latence, confidentialité et réutilisation de l’infrastructure.
- •NVIDIA publie un jeu de données d’apprentissage par renforcement agentique complémentaire, Nemotron-RL-Agentic-Terminal-Pivot, afin de prendre en charge le post-entraînement des capacités d’agent de codage.

À mesure que l’intelligence artificielle passe des interfaces de chatbot à des agents autonomes, les modèles open source répondent de plus en plus aux besoins des entreprises en matière de contrôle sur l’emplacement d’exécution, les paramètres opérationnels et l’évolution des modèles.
NVIDIA a annoncé l’extension de sa famille de modèles Nemotron 3 avec la sortie de Nemotron 3.5 Lightning, un modèle mixture-of-experts de 30 milliards de paramètres mixture-of-experts positionné comme l’option la plus efficace de sa catégorie pour les charges de travail d’IA agentique de longue durée. Ce lancement fait suite à Nemotron 3 Nano et poursuit l’effort de NVIDIA visant à améliorer les modèles ouverts en termes de précision et de rapidité.
Parallèlement à ce nouveau modèle, NVIDIA présente NeMo Switchyard, une bibliothèque open source conçue pour un routage intelligent au sein des outils populaires de développement d’agents. La bibliothèque permet aux entreprises de construire des routeurs adaptés à leurs besoins, en dirigeant automatiquement chaque requête vers le modèle le plus performant et le plus approprié pour la tâche, sans nécessiter de réécriture des applications.
Ensemble, Nemotron 3.5 Lightning et NeMo Switchyard visent à offrir aux organisations un contrôle accru sur le déploiement de l’IA, le lieu d’exécution et l’efficacité opérationnelle sur les PC, stations de travail, centres de données et infrastructures cloud, à mesure que les systèmes agentiques dépassent les simples expériences de conversation avec un seul modèle pour aller vers une automatisation au niveau des flux de travail.
Les agents toujours actifs ont besoin d’un système de modèles
Les systèmes agentiques modernes — des agents toujours actifs — fonctionnent de plus en plus comme des systèmes de modèles, ou ensembles de modèles, chaque modèle étant spécialisé dans des tâches différentes.
Les modèles ouverts Nemotron de NVIDIA sont conçus pour cette architecture. Un modèle de raisonnement de pointe comme Nemotron 3 Ultra ou GPT-5.6 peut planifier et orchestrer un flux de travail, tandis que des modèles plus petits et spécialisés comme Nemotron 3.5 Lightning peuvent exécuter des tâches ciblées telles que la revue de code, l’utilisation d’outils, la surveillance d’alertes de sécurité et la réponse à des questions de facturation.
Alimenter des tâches spécialisées à grand volume avec Nemotron 3.5 Lightning
NVIDIA Nemotron 3.5 Lightning est un modèle ouvert entièrement personnalisable, conçu pour les tâches à grand volume qui alimentent les agents toujours actifs. Il a été développé avec la contribution de la Nemotron Coalition, dont les membres ont fourni des méthodologies d’évaluation, des logiciels d’inférence et des jeux de données pour faire progresser le modèle.
Le modèle offre une vitesse de sortie jusqu’à 4x plus rapide, ce qui se traduit par une exécution 30% plus rapide des tâches agentiques par rapport aux autres modèles de sa catégorie. Et parce qu’il est ouvert et personnalisable, Nemotron 3.5 Lightning peut être facilement post-entraîné avec NVIDIA NeMo sur les données de domaine, les outils et les flux de travail propres à une organisation afin d’améliorer la précision pour des tâches spécialisées.
Des leaders de l’IA dans plusieurs secteurs personnalisent déjà Nemotron 3.5 Lightning pour leurs charges de travail, notamment CrowdStrike pour la cybersécurité, Harvey avec Trajectory pour les services juridiques et CodeRabbit avec Baseten pour la revue de code, afin d’améliorer la précision des tâches agentiques spécifiques à un domaine. Par ailleurs, Lila Sciences contribue à améliorer les capacités de raisonnement pour des tâches agentiques dans les sciences physiques et les sciences du vivant, et Fastino Labs a personnalisé le modèle et observe des précisions de premier plan pour les charges de travail en développement logiciel, finance et santé.
Nemotron 3.5 Lightning donne aussi aux organisations un contrôle sur la confidentialité et le déploiement. Il peut s’exécuter sur des systèmes d’IA locaux — notamment NVIDIA RTX PCs, NVIDIA DGX Spark, NVIDIA DGX Station et NVIDIA Jetson — afin d’aider les utilisateurs à maximiser les investissements dans l’infrastructure existante, ou s’étendre sur des appareils d’IA en périphérie, des stations de travail NVIDIA RTX PRO workstations, des centres de données et des environnements cloud pour les cas d’usage en entreprise. Nemotron 3.5 Lightning peut également fonctionner localement ou sur site pour des tâches spécialisées à grand volume nécessitant des réponses rapides.
Comme pour chaque lancement Nemotron, NVIDIA publie autant de données d’entraînement et de techniques que le permettent les licences, ce qui favorise la traçabilité, l’audit et l’entraînement d’autres modèles. En parallèle de Lightning, NVIDIA publie aussi Nemotron-RL-Agentic-Terminal-Pivot, un jeu de données d’apprentissage par renforcement agentique utilisé pour post-entraîner le modèle en vue de capacités d’agent de codage.
Des applications d’IA plus efficaces grâce au routage de modèles
Certains modèles sont meilleurs pour le codage, d’autres pour le raisonnement, d’autres encore pour les tâches légères, et certains sont optimisés pour une exécution locale afin d’offrir davantage de confidentialité et d’efficacité. Si les clients s’appuient sur un modèle par défaut unique, ils risquent soit de trop dépenser, soit de perdre en qualité ; s’ils gèrent le routage manuellement, cela devient un travail d’intégration susceptible de ralentir un déploiement.
NVIDIA NeMo Switchyard est une bibliothèque open source de routage de modèles pour les agents d’IA. La technologie achemine automatiquement les prompts vers le modèle le plus capable et le plus efficace pour chaque étape d’un flux de travail agentique, en fonction de besoins spécifiques. Les développeurs d’applications agentiques peuvent ajuster ou modifier le routeur avec différents algorithmes de routage pour l’aligner sur leurs priorités, comme les exigences de qualité, de latence et de coût. Dans un système de modèles, les entreprises peuvent créer des agents d’IA puissants avec une meilleure efficacité tokenique.
Des benchmarks internes montrent que NeMo Switchyard maintient une précision de niveau frontier tout en réduisant le coût d’exécution des tâches à près du tiers de celui d’Opus 4.8 utilisé seul.
NVIDIA travaille avec des partenaires de l’écosystème de l’IA pour intégrer un routage intelligent des modèles dans les outils et plateformes déjà utilisés par les développeurs.
Boomi : A évalué Switchyard sur cinq capacités de routage, atteignant 100% de précision de routage par domaine, en dirigeant 59% du trafic vers un modèle affiné 5x plus rapide et en réduisant la latence des tours ultérieurs de 21%.
Cadence : A amélioré l’efficacité de 9.9% en utilisant le ChipStack AI Super Agent pour un cas d’usage de vérification formelle.
Classmethod : Exécute en interne des charges de travail opencode et Fireworks avec NeMo Switchyard, les premiers tests montrant une réduction de coût de 27% tout en maintenant la qualité.
Cognition : A intégré le routeur étagé NeMo Switchyard dans Devin Desktop pour un usage interne chez NVIDIA, obtenant des performances proches du niveau frontier sur FrontierCode Main tout en réduisant le coût moyen de 28% par rapport à l’acheminement de toutes les requêtes vers un seul modèle frontier sous-jacent.
Kong : Fournit le routage avec NeMo Switchyard en natif via Kong AI Gateway.
LangChain : Avec NeMo Switchyard, a obtenu un coût inférieur de 74% sur 145 tâches multi-tours Deep Agents en ne dirigeant que 7% des appels vers un modèle frontier, avec un compromis de 6% sur la précision.
LiteLLM : Ajoute NeMo Switchyard comme plug-in à sa couche proxy afin que les développeurs puissent accéder à ces avantages sans modifier leur pile existante.
Nous Research : A intégré NeMo Switchyard à Hermes pour offrir aux développeurs un système de routage facile à configurer afin d’améliorer l’efficacité des agents.
Ramp : A utilisé NeMo Switchyard pour égaler les performances d’un modèle frontier tout en réduisant les coûts de 58% et le temps d’exécution de 33% dans Ramp SWE-Bench.
Siemens : Évalue la bibliothèque pour améliorer l’efficacité de son Fuse EDA AI Agent.
Nemotron 3.5 Lightning est disponible sur Hugging Face, ModelScope, OpenRouter et build.nvidia.com sous forme de microservice NVIDIA NIM, ainsi qu’au travers d’un vaste écosystème de NVIDIA Cloud Partners, de plateformes de post-entraînement, de plateformes d’inférence et de fournisseurs de services cloud. NeMo Switchyard est disponible sur GitHub et devrait arriver prochainement sur les plateformes des partenaires.