NVIDIA stellt Nemotron 3.5 Lightning und NeMo Switchyard für intelligenteres und effizienteres agentisches KI vor
Wichtige Erkenntnisse
- •Nemotron 3.5 Lightning ist ein vollständig anpassbares, offenes Mixture-of-Experts-Modell mit 30 Milliarden Parametern für hochvolumige Spezialaufgaben in agentischen KI-Workflows.
- •NVIDIA gibt an, dass Nemotron 3.5 Lightning bis zu 4x schnellere Ausgabegeschwindigkeit und 30 % schnellere Erledigung agentischer Aufgaben im Vergleich zu anderen Modellen seiner Klasse liefert.
- •NeMo Switchyard ist eine Open-Source-Routing-Bibliothek, die jede Anfrage automatisch an das leistungsfähigste und kosteneffizienteste Modell weiterleitet und die Kosten pro Aufgabenerledigung auf etwa ein Drittel eines einzelnen Frontier-Modells senkt.
- •Das Modell unterstützt flexible Bereitstellung auf lokalen Systemen, Edge-Geräten, Workstations, Rechenzentren und Cloud-Umgebungen und hilft Unternehmen, Latenz, Datenschutz und Infrastrukturwiederverwendung auszubalancieren.
- •NVIDIA veröffentlicht zusätzlich den agentischen Reinforcement-Learning-Datensatz Nemotron-RL-Agentic-Terminal-Pivot, um das Nachtraining für Coding-Agent-Fähigkeiten zu unterstützen.

Da sich künstliche Intelligenz von Chatbot-Oberflächen hin zu autonomen Agenten verlagert, erfüllen Open-Source-Modelle zunehmend die Anforderungen von Unternehmen nach Kontrolle über Ausführungsort, Betriebsparameter und Modellentwicklung.
NVIDIA hat die Erweiterung seiner Nemotron-3-Modellfamilie mit der Veröffentlichung von Nemotron 3.5 Lightning angekündigt, einem Mixture-of-Experts-Modell mit 30 Milliarden Parametern, das als die effizienteste Option seiner Klasse für lang laufende agentische KI-Workloads positioniert ist. Die Einführung folgt auf Nemotron 3 Nano und setzt NVIDIAs Bemühungen fort, offene Modelle hinsichtlich Genauigkeit und Geschwindigkeit weiter zu verbessern.
Parallel zum neuen Modell führt NVIDIA NeMo Switchyard ein, eine Open-Source-Bibliothek für intelligentes Routing innerhalb gängiger Agenten-Entwicklungstools. Die Bibliothek ermöglicht es Unternehmen, Router nach ihren Anforderungen zu erstellen und jede Anfrage automatisch an das leistungsfähigste und passendste Modell für die jeweilige Aufgabe weiterzuleiten, ohne dass Anwendungen neu geschrieben werden müssen.
Zusammen sollen Nemotron 3.5 Lightning und NeMo Switchyard Unternehmen mehr Kontrolle über die Bereitstellung von KI, den Laufzeitort und die Betriebseffizienz geben — über PCs, Workstations, Rechenzentren und Cloud-Infrastrukturen hinweg, während sich agentische Systeme von einzelnen Chat-Erlebnissen hin zu Workflow-Automatisierung entwickeln.
Dauerhaft aktive Agenten benötigen ein System aus Modellen
Moderne agentische Systeme — sogenannte Always-on-Agenten — arbeiten zunehmend als Systeme aus Modellen oder Modell-Ensembles, in denen verschiedene Modelle auf unterschiedliche Aufgaben spezialisiert sind.
Die offenen Modelle von NVIDIA Nemotron sind für diese Architektur ausgelegt. Ein Frontier-Reasoning-Modell wie Nemotron 3 Ultra oder GPT-5.6 kann einen Workflow planen und orchestrieren, während kleinere spezialisierte Modelle wie Nemotron 3.5 Lightning gezielte Aufgaben wie Code-Review, Tool-Nutzung, Überwachung von Sicherheitswarnungen und die Beantwortung von Abrechnungsfragen übernehmen können.
Hochvolumige Spezialaufgaben mit Nemotron 3.5 Lightning
NVIDIA Nemotron 3.5 Lightning ist ein vollständig anpassbares Open Model, das für hochvolumige Aufgaben entwickelt wurde, die Always-on-Agenten antreiben. Es entstand mit Beiträgen der Nemotron Coalition, deren Mitglieder Evaluierungsmethoden, Inferenzsoftware und Datensätze bereitstellten, um die Weiterentwicklung des Modells zu unterstützen.
Das Modell liefert laut NVIDIA bis zu 4x schnellere Ausgabegeschwindigkeit und damit eine um 30 % schnellere Erledigung agentischer Aufgaben im Vergleich zu anderen Modellen seiner Klasse. Da es offen und anpassbar ist, kann Nemotron 3.5 Lightning mit NVIDIA NeMo auf den eigenen Domänendaten, Tools und Workflows eines Unternehmens nachtrainiert werden, um die Genauigkeit für spezialisierte Aufgaben zu verbessern.
Führende KI-Anwender aus verschiedenen Branchen passen Nemotron 3.5 Lightning bereits an ihre Workloads an:
- CrowdStrike setzt das Modell für Cybersecurity-Anwendungsfälle ein.
- Harvey nutzt es gemeinsam mit Trajectory für juristische Dienstleistungen.
- CodeRabbit verwendet es in Zusammenarbeit mit Baseten für Code-Review.
- Lila Sciences nutzt das Modell, um das Schlussfolgern für agentische Aufgaben in den Natur- und Lebenswissenschaften zu verbessern.
- Fastino Labs hat das Modell angepasst und meldet führende Genauigkeiten für Workloads in Softwareentwicklung, Finanzen und Gesundheitswesen.
Nemotron 3.5 Lightning bietet Unternehmen zudem Flexibilität bei Datenschutz und Bereitstellung. Es kann auf lokalen KI-Systemen laufen — darunter NVIDIA RTX PCs, NVIDIA DGX Spark, NVIDIA DGX Station und NVIDIA Jetson — und hilft damit, bestehende Infrastrukturinvestitionen optimal zu nutzen. Es kann außerdem über Edge-KI-Geräte, NVIDIA RTX PRO Workstations, Rechenzentren und Cloud-Umgebungen für Unternehmensanwendungen skaliert werden. Für hochvolumige, spezialisierte Aufgaben mit schnellen Antwortanforderungen kann das Modell lokal oder On-Premises laufen, was für Unternehmen relevant sein kann, die Latenz, Datenschutz und Infrastrukturwiederverwendung ausbalancieren.
Wie bei früheren Nemotron-Starts veröffentlicht NVIDIA zudem so viel von den Trainingsdaten und Methoden, wie es die Lizenz erlaubt, um Nachvollziehbarkeit, Prüfungen und das Training weiterer Modelle zu unterstützen. Neben Lightning veröffentlicht NVIDIA außerdem Nemotron-RL-Agentic-Terminal-Pivot, einen agentischen Reinforcement-Learning-Datensatz, der für das Nachtraining des Modells für Coding-Agent-Fähigkeiten verwendet wird.
Effizientere KI-Apps mit Model Routing
Verschiedene Modelle sind für unterschiedliche Aufgaben besser geeignet — einige sind für Coding optimiert, andere für Schlussfolgern, leichte Aufgaben oder den lokalen Betrieb für mehr Datenschutz. Wenn Kunden sich auf ein einziges Standardmodell verlassen, zahlen sie möglicherweise zu viel oder verlieren an Qualität; wenn sie das Routing manuell verwalten, entsteht Integrationsaufwand, der eine Bereitstellung verlangsamen kann.
NeMo Switchyard adressiert dies, indem es Prompts automatisch an das leistungsfähigste und effizienteste Modell für jeden Schritt eines Agenten-Workflows weiterleitet. Entwickler können den Router mit unterschiedlichen Routing-Algorithmen an ihre Prioritäten wie Qualität, Latenz und Kosten anpassen oder ihn modifizieren. Interne Benchmarks von NVIDIA zeigen, dass NeMo Switchyard eine Genauigkeit auf Frontier-Niveau beibehält und gleichzeitig die Kosten pro Aufgabenerledigung auf nahezu ein Drittel von Opus 4.8 allein senkt.
NVIDIA arbeitet mit Partnern im gesamten KI-Ökosystem zusammen, um intelligentes Model Routing in die Tools und Plattformen zu bringen, die Entwickler bereits nutzen.
Boomi: Bewertete Switchyard über fünf Routing-Fähigkeiten hinweg, erreichte eine Domain-Routing-Genauigkeit von 100 %, leitete 59 % des Traffics an ein 5x schnelleres feinabgestimmtes Modell und senkte die Latenz in späteren Gesprächsrunden um 21 %.
Cadence: Verbesserte die Effizienz um 9,9 % durch den Einsatz des ChipStack AI Super Agent für einen Anwendungsfall der formalen Verifikation.
Classmethod: Führt intern opencode- und Fireworks-Workloads mit NeMo Switchyard aus; erste Tests zeigten eine Kostenreduktion von 27 % bei gleichbleibender Qualität.
Cognition: Integrierte den gestuften Router von NVIDIA NeMo Switchyard in Devin Desktop für den internen Einsatz bei NVIDIA, erzielte nahezu Frontier-Niveau bei FrontierCode Main und senkte die durchschnittlichen Kosten um 28 % gegenüber dem Routing aller Anfragen an ein einziges zugrunde liegendes Frontier-Modell.
Kong: Stellt Routing mit NeMo Switchyard nativ über Kong AI Gateway bereit.
LangChain: Erreichte mit NeMo Switchyard 74 % geringere Kosten in 145 mehrstufigen Deep-Agents-Aufgaben, indem nur 7 % der Aufrufe an ein Frontier-Modell weitergeleitet wurden, bei einem Genauigkeitskompromiss von 6 %.
LiteLLM: Fügt NeMo Switchyard als Plug-in in seine Proxy-Schicht ein, damit Entwickler diese Vorteile ohne Änderungen an ihrem bestehenden Stack nutzen können.
Nous Research: Integrierte NeMo Switchyard in Hermes, um Entwicklern ein einfach zu konfigurierendes Routing-System zur Verbesserung der Agenteneffizienz bereitzustellen.
Ramp: Nutze NeMo Switchyard, um die Leistung eines Frontier-Modells zu erreichen, während die Kosten um 58 % und die Laufzeit um 33 % in Ramp SWE-Bench gesenkt wurden.
Siemens: Führt Benchmarks durch, um die Effizienz seines Fuse EDA AI Agent zu verbessern.
Nemotron 3.5 Lightning ist auf Hugging Face, ModelScope, OpenRouter und build.nvidia.com als NVIDIA NIM Microservice sowie über ein breites Ökosystem von NVIDIA Cloud Partners, Post-Training-Plattformen, Inferenzplattformen und Cloud-Service-Providern verfügbar. NeMo Switchyard ist auf GitHub verfügbar und soll in Kürze auf Partnerplattformen erscheinen.