NVIDIA lanceert Nemotron 3.5 Lightning en NeMo Switchyard voor slimmere, efficiëntere agentische AI
Belangrijkste punten
- •Nemotron 3.5 Lightning is een volledig aanpasbaar open mixture-of-experts-model met 30 miljard parameters, ontworpen voor gespecialiseerde taken met hoge volumes binnen agentische AI-workflows.
- •NVIDIA meldt dat Nemotron 3.5 Lightning tot 4x snellere uitvoersnelheid en 30% snellere voltooiing van agentische taken levert vergeleken met andere modellen in zijn klasse.
- •NeMo Switchyard is een open-source routeringsbibliotheek die elke prompt automatisch naar het meest capabele en kostenefficiënte model stuurt, waardoor de kosten per voltooide taak dalen tot ongeveer een derde van het gebruik van één frontiermodel.
- •Het model ondersteunt flexibele implementatie op lokale systemen, edge-apparaten, workstations, datacenters en cloudomgevingen, zodat organisaties latency, privacy en hergebruik van infrastructuur kunnen afwegen.
- •NVIDIA brengt een bijbehorende agentische reinforcement learning-dataset uit, Nemotron-RL-Agentic-Terminal-Pivot, ter ondersteuning van natraining voor codeagentmogelijkheden.

Terwijl kunstmatige intelligentie verschuift van chatbotinterfaces naar autonome agents, voorzien open-source modellen steeds meer in de vraag van ondernemingen naar controle over de locatie van de uitvoering, operationele parameters en modelontwikkeling.
NVIDIA heeft de uitbreiding van zijn Nemotron 3-modelfamilie aangekondigd met de release van Nemotron 3.5 Lightning, een mixture-of-experts model met 30 miljard parameters dat wordt gepositioneerd als de meest efficiënte optie in zijn klasse voor langdurige agentische AI-workloads. De lancering volgt op Nemotron 3 Nano en onderstreept NVIDIA's inzet om open modellen verder te verfijnen voor hogere nauwkeurigheid en snelheid.
Naast het nieuwe model introduceert NVIDIA NeMo Switchyard, een open-source bibliotheek voor intelligente routering binnen populaire tools voor agentontwikkeling. Met de bibliotheek kunnen ondernemingen routers op maat bouwen voor hun behoeften, waarbij elke aanvraag automatisch wordt doorgestuurd naar het meest capabele en geschikte model voor de taak, zonder dat applicaties opnieuw hoeven te worden geschreven.
Samen moeten Nemotron 3.5 Lightning en NeMo Switchyard organisaties meer controle geven over de implementatie van AI, de locatie van de uitvoering en de operationele efficiëntie op pc's, workstations, datacenters en cloudinfrastructuur, nu agentische systemen evolueren van single-model chatervaringen naar automatisering op workflowniveau.
Altijd actieve agents en de systeem-van-modellenarchitectuur
Moderne agentische systemen — gekenmerkt als altijd actieve agents — functioneren steeds vaker als ensembles van gespecialiseerde modellen, elk geoptimaliseerd voor verschillende taken. NVIDIA ontwierp zijn open Nemotron-modellen voor deze architectuur. Een frontier-redeneermodel zoals Nemotron 3 Ultra of GPT-5.6 kan een workflow plannen en orkestreren, terwijl kleinere gespecialiseerde modellen zoals Nemotron 3.5 Lightning gerichte taken uitvoeren zoals codereview, gebruik van tools, monitoring van beveiligingsmeldingen en het beantwoorden van vragen over facturering.
Nemotron 3.5 Lightning: gebouwd voor gespecialiseerde taken met hoge volumes
Nemotron 3.5 Lightning is een volledig aanpasbaar open model dat is ontwikkeld voor taken met hoge volumes die altijd actieve agents aandrijven. Het model is gebouwd met bijdragen van de Nemotron Coalition, waarvan de leden evaluatiemethodologieën, inferentiesoftware en datasets aanleverden om de mogelijkheden van het model verder te ontwikkelen.
Volgens NVIDIA levert Nemotron 3.5 Lightning tot 4x snellere uitvoersnelheid, wat resulteert in 30% snellere voltooiing van agentische taken vergeleken met andere modellen in zijn klasse. Omdat het model open en aanpasbaar is, kunnen organisaties het met NVIDIA NeMo natrainen op hun eigen domeingegevens, tools en workflows om de nauwkeurigheid voor gespecialiseerde toepassingen te verbeteren.
Verschillende AI-leiders in uiteenlopende sectoren passen Nemotron 3.5 Lightning al aan voor hun specifieke workloads:
- CrowdStrike past het model toe op cybersecuritytoepassingen.
- Harvey, in samenwerking met Trajectory, zet het in voor juridische diensten.
- CodeRabbit, in samenwerking met Baseten, gebruikt het voor codereview.
- Lila Sciences benut het model om redeneren voor agentische taken binnen de fysieke en levenswetenschappen te verbeteren.
- Fastino Labs heeft het model aangepast en meldt toonaangevende nauwkeurigheid voor workloads in softwareontwikkeling, finance en gezondheidszorg.
Nemotron 3.5 Lightning biedt organisaties ook flexibiliteit op het gebied van privacy en implementatie. Het kan draaien op lokale AI-systemen — waaronder NVIDIA RTX PCs, NVIDIA DGX Spark, NVIDIA DGX Station en NVIDIA Jetson — om gebruikers te helpen bestaande infrastructuurinvesteringen maximaal te benutten. Het kan ook opschalen over edge-AI-apparaten, NVIDIA RTX PRO workstations, datacenters en cloudomgevingen voor zakelijke toepassingen. Voor gespecialiseerde taken met hoge volumes die snelle reacties vereisen, kan het model lokaal of on-premises draaien, wat relevant kan zijn voor organisaties die latency, privacy en hergebruik van infrastructuur afwegen.
Net als bij eerdere Nemotron-lanceringen publiceert NVIDIA zoveel van de trainingsgegevens en methoden als de licentie toestaat, wat traceerbaarheid, auditing en verdere modeltraining ondersteunt. Samen met Lightning brengt NVIDIA ook Nemotron-RL-Agentic-Terminal-Pivot uit, een agentische reinforcement learning-dataset die wordt gebruikt om het model natraining te geven voor mogelijkheden van codeagents.
NeMo Switchyard: efficiënte modelroutering voor AI-agents
Verschillende modellen zijn beter in verschillende taken — sommige zijn geoptimaliseerd voor coderen, andere voor redeneren, lichte bewerkingen of lokale uitvoering voor privacy. Vertrouwen op één standaardmodel kan leiden tot te hoge kosten of kwaliteitsverlies, terwijl handmatige routering extra integratiewerk toevoegt dat implementaties kan vertragen.
NeMo Switchyard pakt dit aan door prompts automatisch te routeren naar het meest capabele en efficiënte model voor elke stap van een agent-workflow. Ontwikkelaars kunnen de router afstemmen met verschillende algoritmen om aan prioriteiten als kwaliteit, latency en kosten te voldoen. Interne benchmarks van NVIDIA geven aan dat NeMo Switchyard frontier-niveau nauwkeurigheid behoudt terwijl de kosten per voltooide taak dalen tot ongeveer een derde van het gebruik van Opus 4.8 alleen.
Voor teams die productieagents bouwen, vormt die routeringslaag een praktische middenweg tussen algemene inferentie en maatwerkorkestratie voor elke applicatie. NVIDIA werkt samen met partners in het AI-ecosysteem om intelligente modelroutering te integreren in de ontwikkeltools en platforms die ontwikkelaars al gebruiken. Vroege resultaten zijn onder meer:
- Boomi: Beoordeelde Switchyard op vijf routeringsmogelijkheden, behaalde 100% domein-routeringsnauwkeurigheid, stuurde 59% van het verkeer naar een 5x sneller fijn-afgestemd model en verminderde de latency in latere beurten met 21%.
- Cadence: Verhoogde de efficiëntie met 9.9% door de ChipStack AI Super Agent te gebruiken voor een use case rond formele verificatie.
- Classmethod: Draait intern opencode- en Fireworks-workloads met NeMo Switchyard, waarbij de eerste tests een kostenreductie van 27% lieten zien met behoud van kwaliteit.
- Cognition: Integreerde de gefaseerde router van NeMo Switchyard in Devin Desktop voor intern gebruik bij NVIDIA, met bijna frontier-prestaties op FrontierCode Main en een daling van de gemiddelde kosten met 28% ten opzichte van het routeren van alle aanvragen naar één onderliggend frontiermodel.
- Kong: Levert routering met NeMo Switchyard native via Kong AI Gateway.
- LangChain: Bereikte 74% lagere kosten bij 145 multi-turn Deep Agents-taken door slechts 7% van de calls naar een frontiermodel te routeren, met een nauwkeurigheidsafweging van 6%.
- LiteLLM: Voegt NeMo Switchyard toe als plug-in aan de proxylaag, zodat ontwikkelaars deze voordelen kunnen gebruiken zonder hun bestaande stack te wijzigen.
- Nous Research: Integreerde NeMo Switchyard in Hermes om ontwikkelaars een eenvoudig configureerbaar routeringssysteem te bieden.
- Ramp: Gebruikte NeMo Switchyard om de prestaties van een frontiermodel te evenaren, terwijl de kosten met 58% en de runtime met 33% werden verlaagd in Ramp SWE-Bench.
- Siemens: Benchmarkt de bibliotheek om de efficiëntie in zijn Fuse EDA AI Agent te verbeteren.
Beschikbaarheid
Nemotron 3.5 Lightning is beschikbaar op Hugging Face, ModelScope, OpenRouter en build.nvidia.com als NVIDIA NIM-microservice, evenals via een breed ecosysteem van NVIDIA Cloud Partners, post-trainingplatforms, inferentieplatforms en cloudserviceproviders. NeMo Switchyard is beschikbaar op GitHub en zal binnenkort op partnerplatforms verschijnen.