NieuwsAandelenNVIDIA breidt Nemotron 3-familie uit met Nemotron 3.5 Lightning, een open MoE-model met 30 miljard parameters voor AI-agentwerkbelasting

NVIDIA breidt Nemotron 3-familie uit met Nemotron 3.5 Lightning, een open MoE-model met 30 miljard parameters voor AI-agentwerkbelasting

Auteur: Hokanews·

Belangrijkste punten

  • Nemotron 3.5 Lightning gebruikt een Mixture-of-Experts-ontwerp met ongeveer 3 miljard actieve parameters van in totaal 30 miljard parameters.
  • Volgens NVIDIA is het model geoptimaliseerd voor altijd actieve, latentiearme agentworkloads en niet alleen voor complexe redeneertaken.
  • Het bedrijf meldt dat het model op 10.000 taken 30% sneller was dan Qwen3.6 35B bij vergelijkbare nauwkeurigheid en tot vier keer sneller output leverde dan vergelijkbare modellen in zijn klasse.
  • NVIDIA geeft de modelgewichten, trainingsdata en recipes vrij onder een OpenMDW-1.1-licentie, met ondersteuning voor fine-tuning via NeMo-tools.
  • NVIDIA introduceerde ook NeMo Switchyard om werk te routeren tussen grotere redeneermodellen en kleinere uitvoeringsgerichte modellen zoals Nemotron 3.5 Lightning.
NVIDIA breidt Nemotron 3-familie uit met Nemotron 3.5 Lightning, een open MoE-model met 30 miljard parameters voor AI-agentwerkbelasting

NVIDIA heeft zijn Nemotron 3-familie van kunstmatige-intelligentiemodellen uitgebreid met de release van Nemotron 3.5 Lightning, een open Mixture-of-Experts (MoE)-model met 30 miljard parameters dat specifiek is ontworpen voor AI-agentwerkbelasting met hoge volumes.

Het nieuwe model richt zich op een groeiende categorie AI-toepassingen die continu werken en taken afhandelen zoals tool calls, gegevensverwerking, softwarebewerkingen, resultaatsvalidatie en communicatie tussen verschillende AI-systemen. NVIDIA stelt dat Nemotron 3.5 Lightning tot vier keer sneller output kan leveren dan vergelijkbare modellen in zijn klasse, terwijl grote batches agentische taken tot 30% sneller worden voltooid bij vergelijkbare nauwkeurigheidsniveaus.

De aankondiging voegt een nieuwe dimensie toe aan NVIDIA’s bredere AI-strategie. Het bedrijf richt zich niet langer uitsluitend op het leveren van processors voor het draaien van AI-systemen; het ontwikkelt steeds vaker modellen, software en tools die bedrijven moeten helpen AI-toepassingen te bouwen en uit te rollen op NVIDIA-hardware. Daarmee positioneert NVIDIA zich niet alleen tegenover chipfabrikanten zoals AMD en Intel, maar ook tegenover modelaanbieders zoals Meta (Llama), Alibaba (Qwen), Mistral AI en Google (Gemma) in de markt voor open-weight AI.

NVIDIA richt zich op de volgende fase van AI-agents

Het nieuwste Nemotron-model verschijnt op een moment dat AI-agents een belangrijk speerpunt zijn in de technologiesector. Traditionele AI-assistenten reageren doorgaans op afzonderlijke prompts, terwijl een agent een groter doel kan opdelen in meerdere acties, externe tools kan gebruiken, informatie kan ophalen, opdrachten kan uitvoeren en resultaten kan evalueren voordat hij verdergaat. Bedrijven als OpenAI, Anthropic, Google en Microsoft hebben allemaal aangegeven dat agentische AI — systemen met meer autonomie — een belangrijk front vormt.

Deze systemen kunnen een zeer groot aantal modelaanroepen genereren. Een AI-codingagent kan bijvoorbeeld bestanden moeten inspecteren, opdrachten uitvoeren, fouten bekijken, code aanpassen en herhaaldelijk tests draaien voordat één taak is afgerond. Elke afzonderlijke stap vereist mogelijk niet het krachtigste redeneermodel dat beschikbaar is; ontwikkelaars geven mogelijk de voorkeur aan een kleiner model dat repetitieve taken snel en efficiënt kan uitvoeren.

Dat is de markt waarop NVIDIA zich met Nemotron 3.5 Lightning richt. Het bedrijf zegt dat het model is geoptimaliseerd voor uitvoering met hoog volume en lage latentie, in plaats van uitsluitend te worden gebruikt voor de meest complexe redeneerworkloads.

Een model met 30 miljard parameters en 3 miljard actieve parameters

Een belangrijk technisch kenmerk van Nemotron 3.5 Lightning is de Mixture-of-Experts-architectuur. Hoewel het model in totaal 30 miljard parameters bevat, stelt NVIDIA dat tijdens een gegeven forward pass ongeveer 3 miljard parameters actief zijn. Daardoor behoudt het model de capaciteit van een aanzienlijk groter systeem, terwijl de hoeveelheid berekening die per token nodig is, afneemt. MoE-architecturen winnen terrein in de sector, met modellen als DeepSeek-V3, Mistral’s Mixtral en xAI’s Grok die vergelijkbare benaderingen gebruiken om het aantal parameters op te schalen zonder de inference-compute evenredig te verhogen.

In een traditioneel dicht model neemt in feite de volledige parameterverzameling deel aan de verwerking van elke invoer. Een MoE-model werkt anders: een routeringssysteem bepaalt welke experts een bepaald token of een deel van een taak moeten afhandelen. Alleen geselecteerde experts worden geactiveerd, waardoor het systeem de rekenlast kan verlagen terwijl het totale parameterbudget groot blijft.

NVIDIA stelt dat dit ontwerp Nemotron 3.5 Lightning geschikt maakt voor workloads met hoog volume waarbij snelheid en efficiëntie cruciaal zijn. Met 30 miljard totale parameters en 3 miljard actieve parameters behoort het tot de kleinere leden van de bredere Nemotron 3-familie, terwijl het capaciteiten behoudt die zijn bedoeld voor geavanceerde agentische workflows.

Gebouwd voor always-on AI

Het concept van "always-on AI agents" staat centraal in NVIDIA’s positionering van het nieuwe model. Het bedrijf betoogt dat langdurig werkende agents het grootste deel van hun tijd besteden aan relatief routinematige handelingen in plaats van complexe redenering. Die handelingen kunnen bestaan uit tool calls, het valideren van output, het formatteren van informatie, het ophalen van bestanden en het delegeren van taken aan andere modellen.

Het telkens inzetten van een groot frontier-reasoningmodel voor elke afzonderlijke handeling kan zowel de latentie als de kosten voor rekenkracht verhogen. NVIDIA’s aanpak is om de werkbelasting over verschillende modellen te verdelen: een groter model kan strategische planning en complexe redenering afhandelen, terwijl Nemotron 3.5 Lightning de repetitieve uitvoeringsstappen voor zijn rekening neemt. NVIDIA beschrijft dit als een "system of models" in plaats van één enkel model dat verantwoordelijk is voor elke taak.

Snelheid is een kernkenmerk

NVIDIA benadrukt de inferentiesnelheid als een van de bepalende eigenschappen van Nemotron 3.5 Lightning. Het bedrijf meldt dat het model op PinchBench een nauwkeurigheid van 86% bereikte en 10.000 taken 30% sneller afrondde dan Qwen3.6 35B bij vergelijkbare nauwkeurigheid. NVIDIA rapporteert ook dat Nemotron 3.5 Lightning de accuracy-speed Pareto-frontier bereikt in de Artificial Analysis Intelligence Index.

Deze cijfers zijn door NVIDIA gerapporteerde resultaten en geen onafhankelijke bevestiging. Toch weerspiegelt de nadruk op doorvoer de richting van de AI-markt. Naarmate AI in productieomgevingen terechtkomt, letten ontwikkelaars steeds meer op hoe snel en efficiënt modellen echte workloads kunnen afronden, in plaats van alleen op hun prestaties op afzonderlijke benchmarkvragen.

Waarom inferentie-efficiëntie belangrijk is

Het trainen van grote AI-modellen krijgt veel aandacht vanwege de enorme rekenkracht die daarvoor nodig is, maar inferentie wordt een even belangrijk onderdeel van de AI-economie. Branche-analisten hebben geraamd dat inferentie inmiddels al een aanzienlijk en groeiend deel van de totale AI-rekenuitgaven vertegenwoordigt, nu modellen van ontwikkeling naar live productie gaan en miljarden queries verwerken. Elke keer dat een AI-systeem op een verzoek reageert, code genereert, informatie ophaalt of een geautomatiseerde taak voltooit, wordt rekenkracht verbruikt. Voor een AI-agent die continu draait, kunnen die kosten snel oplopen.

Een model dat sneller antwoorden produceert en minder actieve parameters vereist, kan mogelijk de hoeveelheid benodigde rekeninfrastructuur voor een bepaalde workload verminderen. NVIDIA’s nieuwste model pakt daarmee een praktisch probleem aan: hoe autonome AI-systemen continu te laten werken zonder elke afzonderlijke taak onnodig duur te maken.

Aanpasbaarheid en open-weight AI

NVIDIA positioneert Nemotron 3.5 Lightning ook als een aanpasbaar model. Ontwikkelaars krijgen de gewichten, trainingsdata en recipes van het model onder een soepele OpenMDW-1.1-licentiestructuur, waardoor zij het model kunnen afstemmen op specifieke toepassingen. NVIDIA zegt dat het model kan worden verfijnd met LoRA of volledige supervised fine-tuning via NVIDIA’s NeMo-tools, en ontwikkelaars kunnen ook reinforcement learning en evaluaties op basis van omgevingen gebruiken.

De release weerspiegelt NVIDIA’s voortdurende inzet op open-weight AI. In plaats van ontwikkelaars uitsluitend via een propriëtair API toegang te geven tot een model, bieden open-weight modellen meer controle over de uitrol. Organisaties kunnen modellen op hun eigen infrastructuur draaien, aanpassen voor specifieke use cases en integreren in bestaande AI-systemen — een benadering die vooral belangrijk kan zijn voor bedrijven die gevoelige informatie verwerken. Deze benadering sluit aan bij een bredere trend in de sector: Meta’s Llama-modellen, Alibaba’s Qwen-serie, de releases van Mistral AI en Google’s Gemma-lijn hebben allemaal een sterke vraag laten zien naar downloadbare, aanpasbare AI-modellen.

Ontworpen voor lokale en datacenter-uitrol

Volgens NVIDIA’s modeldocumentatie kan Nemotron 3.5 Lightning onder bepaalde configuraties draaien op één DGX Spark-systeem of op een H100 GPU. Het wordt ook ondersteund op NVIDIA Blackwell-hardware en Hopper-generatie GPU’s, met extra uitrolopties via ondersteunde inferentiekaders. Die flexibiliteit maakt het model geschikt voor ontwikkelaars die experimenteren met autonome agents op lokale systemen, evenals voor bedrijven die grote productieomgevingen beheren.

Een hybride architectuur

Nemotron 3.5 Lightning leunt niet uitsluitend op een conventionele Transformer-architectuur. NVIDIA beschrijft het als een hybride systeem dat Mamba-2, Mixture-of-Experts-lagen en geselecteerde attention-lagen combineert. De architectuur is bedoeld om computationele efficiëntie in balans te brengen met de mogelijkheid om complexe sequenties te verwerken. Mamba-achtige componenten kunnen bepaalde geheugeneisen tijdens sequentieverwerking verlagen, terwijl MoE-lagen het model in staat stellen het totale aantal parameters op te schalen zonder alle parameters voor elk token te activeren. Attention-lagen blijven belangrijk voor taken waarbij gedetailleerde relaties tussen tokens nodig zijn. Door deze benaderingen te combineren probeert NVIDIA een model te creëren dat hoge throughput levert zonder in te leveren op de mogelijkheden die nodig zijn voor agentische workflows.

Contextlengte loopt op tot 1 miljoen tokens

Een andere opvallende specificatie is de contextcapaciteit van het model. NVIDIA’s modeldocumentatie vermeldt ondersteuning voor contextlengtes tot 1 miljoen tokens. Een groot contextvenster kan nuttig zijn voor AI-agents die uitgebreide documenten, broncoderepositories, logbestanden of lange taakgeschiedenissen moeten verwerken. Een agent die aan een groot softwareproject werkt, kan bijvoorbeeld toegang nodig hebben tot veel bestanden en eerdere interacties. Een langere context kan de noodzaak verminderen om informatie steeds opnieuw samen te vatten of weg te laten.

Een groot contextvenster betekent echter niet automatisch dat elke toepassing er evenveel voordeel van heeft. De werkelijke prestaties hangen af van de workload, de inferentieconfiguratie en de hardware. Toch laat de mogelijkheid zien dat NVIDIA zich richt op AI-systemen die ontworpen zijn om over lange en complexe taken heen te werken.

Bron: Xpost

Nemotron 3.5 Lightning sluit aan bij een groeiende familie

De nieuwste release breidt een al bredere Nemotron 3-familie uit. NVIDIA introduceerde eerder meerdere modellen voor verschillende niveaus van AI-workloads, waaronder kleinere modellen voor efficiënte uitvoering en grotere systemen voor complexe redenering en multi-agenttoepassingen. De strategie van het bedrijf is steeds meer gebaseerd op specialisatie. In plaats van ervan uit te gaan dat één model elke taak moet uitvoeren, bouwt NVIDIA een verzameling modellen met verschillende sterke punten.

Nemotron 3.5 Lightning is gepositioneerd aan de kant van uitvoering met hoog volume binnen dat spectrum. Daardoor kan het eerder complementair zijn aan grotere redeneersystemen dan een directe vervanging daarvan.

NVIDIA introduceert modelroutering met NeMo Switchyard

Naast het nieuwe model promoot NVIDIA NeMo Switchyard, een bibliotheek die is ontworpen om taken naar verschillende modellen te routeren. Het concept is relatief eenvoudig. Een systeem kan bepalen of een bepaalde taak een krachtig redeneermodel vereist of dat een kleiner en sneller model die taak kan uitvoeren. Een ingewikkeld planningsverzoek kan bijvoorbeeld naar een frontier-reasoningsysteem worden gestuurd. Zodra het plan is opgesteld, kunnen repetitieve uitvoeringstaken worden doorgegeven aan Nemotron 3.5 Lightning. NVIDIA zegt dat Switchyard ontwikkelaars in staat stelt Lightning naast open en gesloten modellen aan te bieden en individuele verzoeken te routeren op basis van hun vereisten.

Als deze modelrouteringsaanpak wijdverspreid raakt, kunnen AI-toepassingen steeds meer functioneren als netwerken van gespecialiseerde modellen. Als vergelijkbare routeringsconcepten zijn verkend door platformen zoals de modellenfamilie van OpenAI en verschillende open-source orkestratiekaders.

De economie van AI-agents

De economie van AI-agents kan een van de belangrijkste thema’s worden in de volgende fase van de sector. Een chatbot reageert mogelijk één keer op een gebruiker, maar een autonome agent kan honderden of duizenden handelingen uitvoeren om één doel te voltooien. Als een ontwikkelaar een kleiner model kan gebruiken voor routinematige uitvoering en dure redeneermodellen kan reserveren voor moeilijke beslissingen, kan de totale kost van een AI-systeem mogelijk dalen. NVIDIA zet erop in dat deze taakverdeling een standaardarchitectuur wordt voor agentische systemen op schaal.

Coderen is een belangrijke use case

Softwareontwikkeling is een van de gebieden waar AI-agents al steeds actiever worden. Coding agents kunnen repositories inspecteren, programma’s schrijven, tests uitvoeren, fouten identificeren en correcties aanbrengen — workflows die herhaalde interacties met tools vereisen. Producten zoals GitHub Copilot, Cursor en Cognition’s Devin hebben laten zien dat er vraag is naar AI-ondersteunde ontwikkeling. NVIDIA’s documentatie noemt coding en agentische workloads als beoogde toepassingen van het model, waaronder softwareontwikkeling en scenario’s voor toolgebruik. Het bedrijf zegt ook dat het model is getraind met data over coding, tool calling, gestructureerde output en meerstapsworkflows.

Zakelijke toepassingen kunnen aanzienlijk zijn

Ook bedrijven zijn een belangrijk doelwit voor Nemotron 3.5 Lightning. Ondernemingen experimenteren met AI-agents voor klantenondersteuning, intern onderzoek, documentverwerking, IT-operaties, softwareontwikkeling en workflowautomatisering. Veel van deze toepassingen bestaan uit repetitieve stappen. Een klantenservice-agent kan accountinformatie ophalen, een verzoek valideren en records bijwerken. Een intern onderzoeksagent kan documenten verzamelen, informatie ordenen en resultaten doorgeven aan een ander model. Een IT-agent kan opdrachten uitvoeren en verifiëren of de gevraagde wijziging is geslaagd.

Deze taken vereisen niet altijd de diepste mogelijke redenering. Ze vereisen wel betrouwbaarheid en snelheid. Daar ziet NVIDIA een plek voor een model als Nemotron 3.5 Lightning.

NVIDIA’s bredere AI-strategie

De lancering laat ook zien hoe NVIDIA’s AI-activiteiten verder groeien dan GPU’s. Het bedrijf blijft een van ’s werelds belangrijkste leveranciers van versneld rekenhardware, maar de strategie omvat steeds vaker ook de software- en modellagen bovenop die hardware. Door open modellen en ontwikkeltools vrij te geven, kan NVIDIA ontwikkelaars stimuleren om AI-systemen te bouwen die uiteindelijk op NVIDIA-infrastructuur draaien. Hoe breder zijn modellen en software worden toegepast, hoe sterker het mogelijke ecosysteem rond zijn rekenplatformen wordt.

Nemotron maakt daarom deel uit van een bredere poging om NVIDIA neer te zetten als een full-stack AI-platform.

De concurrentie in open AI-modellen neemt toe

NVIDIA betreedt een uiterst competitieve markt voor open modellen. Ontwikkelaars hebben toegang tot modellen van tal van technologiebedrijven en onderzoeksorganisaties. De concurrentie draait niet langer alleen om het aantal parameters. Ontwikkelaars beoordelen modellen steeds vaker op inferentiesnelheid, nauwkeurigheid, contextlengte, licenties, aanpasbaarheid, hardwarevereisten en mogelijkheden voor toolgebruik.

Een model dat iets minder capabel is maar aanzienlijk sneller, kan nuttiger zijn voor een AI-agent in productie. Precies die markt richt Nemotron 3.5 Lightning op.

De uiteindelijke waarde zal afhangen van de vraag of ontwikkelaars de prestaties en aanpasbaarheid aantrekkelijk vinden ten opzichte van concurrerende open modellen.

Wat maakt het Lightning-model anders?

Het belangrijkste onderscheid is de beoogde workload. Nemotron 3.5 Lightning wordt niet gepositioneerd als het ene model dat alle AI-taken moet uitvoeren. NVIDIA ziet het juist als een efficiënte werkpaard-oplossing. Het model kan routinematige taken in hoge volumes uitvoeren, terwijl grotere redeneermodellen zich richten op strategische beslissingen.

Dat lijkt op de manier waarop traditionele softwaresystemen workloads verdelen over gespecialiseerde componenten. Het verschil is dat AI-modellen nu taken dynamisch kunnen opsplitsen op basis van complexiteit. Dat kan AI-systemen efficiënter maken naarmate ze opschalen.

NVIDIA’s prestatieclaims vragen om onafhankelijke evaluatie

NVIDIA’s claims van tot vier keer snellere tokengeneratie en 30% snellere voltooiing zijn belangrijk, maar moeten in context worden bekeken. Benchmarkresultaten kunnen variëren afhankelijk van hardware, softwareconfiguratie, batchgrootte, sequentielengte en concurrerende modellen.

NVIDIA meldt dat Nemotron 3.5 Lightning de accuracy-speed Pareto-frontier bereikt in de Artificial Analysis Intelligence Index en rapporteert een resultaat van 86% op PinchBench met snellere voltooiing van 10.000 taken vergeleken met een genoemd concurrerend model. Onafhankelijke ontwikkelaars en onderzoekers zullen uiteindelijk een breder beeld schetsen wanneer het model in verschillende workloads wordt ingezet.

De vrijgave van de gewichten en documentatie van het model zou dat testen eenvoudiger moeten maken.

Het open-model-ecosysteem kan profiteren

Open-weight releases stellen onderzoekers en ontwikkelaars in staat te bekijken hoe modellen presteren buiten gecontroleerde demonstraties van leveranciers. Dat kan leiden tot meer vergelijkingen, fine-tuningexperimenten en gespecialiseerde toepassingen.

NVIDIA’s release bevat modelgewichten en aanvullende resources die zijn bedoeld om aanpassing te ondersteunen. Het bedrijf biedt ook integratiepaden voor inferentiekaders en hardwareplatformen. Dat kan de adoptie versnellen bij ontwikkelaars die met agentische systemen willen experimenteren zonder zelf een model vanaf nul te bouwen.

Wat dit betekent voor NVIDIA-beleggers

Voor beleggers die NVDA-aandelen volgen, zal de lancering van Nemotron 3.5 Lightning waarschijnlijk niet dezelfde directe financiële betekenis hebben als een grote GPU-productaankondiging. Toch laat het een belangrijke strategische trend zien. NVIDIA probeert zijn technologiestack steeds centraler te maken in AI-ontwikkeling.

Als ontwikkelaars NVIDIA-modellen, optimalisatielibraries en hardware samen gebruiken, kan het bedrijf profiteren van meerdere lagen van het AI-ecosysteem. Het model zelf is mogelijk niet de belangrijkste bron van omzet. De strategische waarde kan juist zitten in het versterken van NVIDIA’s positie als platform waarop AI-toepassingen worden ontwikkeld en uitgerold.

De volgende fase van AI draait mogelijk om efficiëntie

De eerste fase van generatieve AI werd gedomineerd door schaalgrootte van modellen. Bedrijven concurreerden om steeds grotere systemen met meer redeneercapaciteit te bouwen. De volgende fase kan meer gericht zijn op efficiëntie.

Bedrijven hebben AI nodig die continu kan draaien. Ze hebben voorspelbare kosten nodig. Ze hebben snelle reacties nodig. Ze hebben systemen nodig die kunnen integreren met softwaretools en interne data. En ze hebben modellen nodig die kunnen worden aangepast aan gespecialiseerde taken.

Nemotron 3.5 Lightning weerspiegelt die verschuiving. De architectuur met 30 miljard parameters, het ontwerp met 3 miljard actieve parameters en de focus op uitvoering van agentische taken met hoog volume zijn allemaal bedoeld om AI op schaal praktisch te maken.

Coin Bureau en het bredere AI-gesprek

De release heeft ook aandacht getrokken in sociale-mediagemeenschappen rond technologie en cryptovaluta, waaronder discussie die aan het Coin Bureau-account is gekoppeld. De primaire technische informatie in dit rapport komt echter uit NVIDIA’s eigen aankondiging en modeldocumentatie. Ik kon geen specifieke Coin Bureau-post onafhankelijk verifiëren die de prestatieclaims bevestigt, dus die claims worden toegeschreven aan NVIDIA en niet gepresenteerd als onafhankelijk geverifieerd door Coin Bureau.

Dat onderscheid is belangrijk nu AI-bedrijven steeds vaker prestatiecijfers publiceren die kunnen variëren afhankelijk van testomstandigheden.

Wat volgt er voor Nemotron?

De belangrijkste test voor Nemotron 3.5 Lightning zal adoptie in de praktijk zijn. Ontwikkelaars zullen bepalen hoe eenvoudig het model in bestaande agentframeworks kan worden geïntegreerd. Bedrijven zullen de betrouwbaarheid en aanpasbaarheid evalueren. Onderzoekers zullen de prestaties vergelijken met andere open-weight modellen. En infrastructuurproviders zullen bepalen hoe efficiënt het op verschillende schalen kan draaien.

Als ontwikkelaars constateren dat het model grote aantallen routinematige agenttaken betrouwbaar kan afhandelen met sterke nauwkeurigheid, kan NVIDIA een krachtig nieuw onderdeel hebben voor de opkomende agenteneconomie.

Het grotere plaatje

De release van Nemotron 3.5 Lightning weerspiegelt een bredere transformatie in kunstmatige intelligentie. AI verschuift van systemen die alleen vragen beantwoorden naar systemen die werk uitvoeren.

Die overgang vereist modellen die continu kunnen opereren, kunnen samenwerken met softwaretools en grote aantallen afzonderlijke acties kunnen afhandelen. Het krachtigste redeneermodel is daarbij niet altijd de beste keuze. Soms wegen snelheid, efficiëntie en aanpasbaarheid zwaarder.

NVIDIA positioneert Nemotron 3.5 Lightning rond dat idee. Het model combineert een groot totaal parameterbudget met sparse activatie, een hybride architectuur, lange contextondersteuning en tools voor aanpassing. Het doel is niet noodzakelijk om de grootste AI-modellen te vervangen. In plaats daarvan is het ontworpen om naast hen te werken.

Samengevat

NVIDIA heeft zijn Nemotron 3-familie uitgebreid met Nemotron 3.5 Lightning, een open MoE-model met 30 miljard parameters en ongeveer 3 miljard actieve parameters.

Het model is specifiek ontworpen voor uitvoering met hoog volume in always-on AI-agents, waaronder tool calls, coding workflows, resultaatsvalidatie en andere repetitieve taken.

NVIDIA zegt dat Nemotron 3.5 Lightning tot vier keer sneller output kan leveren dan vergelijkbare modellen en 10.000 agentische taken 30% sneller kan afronden dan een genoemd concurrerend model bij vergelijkbare nauwkeurigheid. Die cijfers blijven door de leverancier gerapporteerde prestatieclaims en moeten onafhankelijk worden geëvalueerd op verschillende hardware en workloads.

Het model ondersteunt ook aanpasbaarheid, waarbij NVIDIA gewichten en trainingsmiddelen vrijgeeft die ontwikkelaars kunnen gebruiken voor fine-tuning en reinforcement learning.

De architectuur combineert Mamba-2-, MoE- en attention-componenten, terwijl het model contextlengtes tot 1 miljoen tokens ondersteunt.

De bredere betekenis van de lancering ligt mogelijk in de focus op efficiëntie. Naarmate AI-agents autonomer worden en duizenden afzonderlijke handelingen moeten uitvoeren, is NVIDIA’s voorgestelde oplossing om het werk te verdelen. Grote redeneermodellen kunnen complexe planning afhandelen, terwijl kleinere gespecialiseerde modellen zoals Nemotron 3.5 Lightning routinetaken snel uitvoeren.

Die modelrouteringsstrategie, ondersteund door NeMo Switchyard, kan een belangrijk onderdeel worden van enterprise-AI-architectuur.