NVIDIA wprowadza Nemotron 3.5 Lightning i NeMo Switchyard, aby zapewnić bardziej inteligentną i wydajną agentową sztuczną inteligencję
Najważniejsze informacje
- •Nemotron 3.5 Lightning to w pełni konfigurowalny, otwarty model typu mixture-of-experts z 30 miliardami parametrów, przeznaczony do wysokonakładowych zadań wyspecjalizowanych w przepływach pracy agentowej AI.
- •NVIDIA podaje, że Nemotron 3.5 Lightning zapewnia do 4x szybszą szybkość generowania wyjścia i o 30% szybsze wykonywanie zadań agentowych w porównaniu z innymi modelami w swojej klasie.
- •NeMo Switchyard to otwarta biblioteka routingu, która automatycznie kieruje każde zapytanie do najbardziej wydajnego i opłacalnego modelu, obniżając koszt wykonania zadania do około jednej trzeciej kosztu oparcia się na jednym modelu frontier.
- •Model obsługuje elastyczne wdrażanie na systemach lokalnych, urządzeniach edge, stacjach roboczych, w centrach danych i środowiskach chmurowych, umożliwiając organizacjom równoważenie opóźnień, prywatności i ponownego wykorzystania infrastruktury.
- •NVIDIA udostępnia towarzyszący zbiór danych do uczenia przez wzmacnianie, Nemotron-RL-Agentic-Terminal-Pivot, aby wspierać dalszy trening możliwości agentów kodujących.

W miarę jak sztuczna inteligencja przechodzi od interfejsów chatbotów do autonomicznych agentów, modele open source coraz lepiej odpowiadają na potrzeby przedsiębiorstw w zakresie pełnej kontroli nad tym, gdzie AI działa, jak jest wdrażana i jak się rozwija.
NVIDIA ogłosiła rozszerzenie rodziny modeli Nemotron 3 o Nemotron 3.5 Lightning, model mixture-of-experts o 30 miliardach parametrów, pozycjonowany jako najbardziej wydajny model w swojej klasie do długotrwałych obciążeń agentowej AI. To wydanie następuje po Nemotron 3 Nano i odzwierciedla dążenie NVIDIA do ciągłego ulepszania modeli open source pod kątem większej dokładności i szybkości.
Obok nowego modelu NVIDIA wprowadza NeMo Switchyard, bibliotekę open source przeznaczoną do inteligentnego routingu w popularnych narzędziach do tworzenia agentów. Biblioteka umożliwia przedsiębiorstwom budowę routerów dostosowanych do ich potrzeb, automatycznie kierując każde zapytanie do najbardziej wydajnego i odpowiedniego modelu bez konieczności przepisywania aplikacji.
Łącznie Nemotron 3.5 Lightning i NeMo Switchyard mają dawać organizacjom większą kontrolę nad wdrażaniem AI, miejscem jej uruchamiania oraz efektywnością działania — na komputerach PC, stacjach roboczych, w centrach danych i w chmurze — wraz z przechodzeniem systemów agentowych od pojedynczych rozmów z modelem do automatyzacji na poziomie przepływów pracy.
Zawsze aktywni agenci potrzebują systemu modeli
Nowoczesne systemy agentowe — określane jako zawsze aktywni agenci — coraz częściej działają jako zespoły wyspecjalizowanych modeli, z których każdy jest zoptymalizowany pod inne zadania. Open source'owe modele NVIDIA Nemotron są projektowane właśnie z myślą o takiej architekturze. Model rozumowania klasy frontier, taki jak Nemotron 3 Ultra lub GPT-5.6, może planować i koordynować cały przepływ pracy, podczas gdy mniejsze wyspecjalizowane modele, takie jak Nemotron 3.5 Lightning, wykonują zadania ukierunkowane, takie jak przegląd kodu, użycie narzędzi, monitorowanie alertów bezpieczeństwa czy odpowiadanie na pytania dotyczące rozliczeń.
Nemotron 3.5 Lightning: stworzony do wysokonakładowych zadań wyspecjalizowanych
Nemotron 3.5 Lightning to w pełni konfigurowalny model open source opracowany z myślą o wysokonakładowych zadaniach napędzających zawsze aktywnych agentów. Model powstał przy udziale Nemotron Coalition, której członkowie dostarczyli metodologie oceny, oprogramowanie do inferencji oraz zbiory danych wspierające rozwój modelu.
Według NVIDIA Nemotron 3.5 Lightning zapewnia do 4x szybszą szybkość generowania wyjścia, co przekłada się na o 30% szybsze wykonywanie zadań agentowych w porównaniu z innymi modelami w swojej klasie. Ponieważ model jest otwarty i konfigurowalny, organizacje mogą łatwo poddawać go dalszemu treningowi przy użyciu NVIDIA NeMo na własnych danych domenowych, narzędziach i przepływach pracy, aby zwiększyć dokładność w wyspecjalizowanych zastosowaniach.
Kilku liderów AI z różnych branż już dostosowuje Nemotron 3.5 Lightning do własnych obciążeń:
- CrowdStrike stosuje model w zastosowaniach związanych z cyberbezpieczeństwem.
- Harvey, we współpracy z Trajectory, wdraża go w usługach prawnych.
- CodeRabbit, we współpracy z Baseten, wykorzystuje go do przeglądu kodu.
- Lila Sciences wykorzystuje model do poprawy zdolności rozumowania w zadaniach agentowych w obszarze nauk fizycznych i przyrodniczych.
- Fastino Labs dostosowało model i raportuje najlepsze wyniki dokładności w obciążeniach związanych z tworzeniem oprogramowania, finansami i ochroną zdrowia.
Nemotron 3.5 Lightning daje również organizacjom elastyczność w zakresie prywatności i wdrożenia. Może działać na lokalnych systemach AI — w tym na NVIDIA RTX PCs, NVIDIA DGX Spark, NVIDIA DGX Station i NVIDIA Jetson — pomagając użytkownikom maksymalnie wykorzystać istniejącą infrastrukturę. Może też skalować się na urządzeniach edge AI, NVIDIA RTX PRO workstations, w centrach danych i środowiskach chmurowych dla zastosowań korporacyjnych. W przypadku wysokonakładowych, wyspecjalizowanych zadań wymagających szybkich odpowiedzi model może działać lokalnie lub on-premises, co może być istotne dla organizacji równoważących opóźnienia, prywatność i ponowne wykorzystanie infrastruktury.
Podobnie jak przy poprzednich premierach Nemotron, NVIDIA publikuje tak dużo danych treningowych i metod, jak pozwala na to licencja, co wspiera identyfikowalność, audyt i dalsze trenowanie innych modeli. Wraz z Lightning NVIDIA udostępnia także Nemotron-RL-Agentic-Terminal-Pivot, zbiór danych do uczenia przez wzmacnianie dla systemów agentowych, używany do dalszego treningu modelu pod kątem możliwości agentów kodujących.
Bardziej wydajne aplikacje AI dzięki routingowi modeli
Różne modele są lepsze do różnych zadań — jedne są zoptymalizowane pod kodowanie, inne pod rozumowanie, lekkie operacje lub lokalne uruchamianie ze względu na prywatność. Poleganie na jednym domyślnym modelu może prowadzić do nadmiernych kosztów albo spadku jakości, a ręczne zarządzanie routingiem wprowadza dodatkową pracę integracyjną, która może spowolnić wdrożenie.
NeMo Switchyard to biblioteka open source do routingu modeli dla agentów AI. Technologia automatycznie kieruje prompty do najbardziej wydajnego i efektywnego modelu na każdym etapie przepływu pracy agenta, zgodnie z konkretnymi potrzebami. Twórcy aplikacji agentowych mogą dostrajać lub modyfikować router za pomocą różnych algorytmów routingu, aby dopasować go do priorytetów takich jak jakość, opóźnienie i koszt. W systemie modeli przedsiębiorstwa mogą tworzyć wydajne agentowe systemy AI z lepszą ekonomią tokenów.
Wewnętrzne benchmarki pokazują, że NeMo Switchyard utrzymuje dokładność na poziomie modeli frontier, jednocześnie obniżając koszt ukończenia zadania do niemal jednej trzeciej kosztu samego Opus 4.8.
NVIDIA współpracuje z partnerami w całym ekosystemie AI, aby wprowadzić inteligentny routing modeli do narzędzi i platform, których twórcy już używają.
Boomi: Oceniło Switchyard w pięciu możliwościach routingu, uzyskując 100% dokładności routingu domenowego, kierując 59% ruchu do 5x szybszego modelu po dostrojeniu i zmniejszając opóźnienie w późniejszych turach o 21%.
Cadence: Poprawiło wydajność o 9.9% przy użyciu ChipStack AI Super Agent w przypadku użycia związanym z formalną weryfikacją.
Classmethod: Wewnętrznie uruchamia obciążenia opencode i Fireworks z użyciem NeMo Switchyard, a wstępne testy wykazały 27% redukcję kosztów przy zachowaniu jakości.
Cognition: Zintegrowało etapowy router NeMo Switchyard z Devin Desktop do użytku wewnętrznego NVIDIA, osiągając wydajność bliską poziomu frontier w FrontierCode Main i obniżając średni koszt o 28% względem kierowania wszystkich zapytań do jednego bazowego modelu frontier.
Kong: Zapewnia routing natywnie z NeMo Switchyard za pośrednictwem Kong AI Gateway.
LangChain: Dzięki NeMo Switchyard uzyskało 74% niższy koszt w 145 wieloturowych zadaniach Deep Agents, kierując tylko 7% wywołań do modelu frontier, przy kompromisie 6% dokładności.
LiteLLM: Dodaje NeMo Switchyard jako wtyczkę do swojej warstwy proxy, aby twórcy mogli korzystać z tych korzyści bez zmiany istniejącego stosu.
Nous Research: Zintegrowało NeMo Switchyard z Hermes, aby zapewnić twórcom łatwy w konfiguracji system routingu zwiększający wydajność agentów.
Ramp: Użyło NeMo Switchyard, aby dorównać wydajności modelu frontier, jednocześnie obniżając koszty o 58% i czas działania o 33% w Ramp SWE-Bench.
Siemens: Prowadzi benchmarki, aby poprawić wydajność swojego Fuse EDA AI Agent.
Nemotron 3.5 Lightning jest dostępny na Hugging Face, ModelScope, OpenRouter i build.nvidia.com jako usługa NVIDIA NIM microservice, a także w szerokim ekosystemie partnerów chmurowych NVIDIA, platform do post-treningu, platform inferencyjnych i dostawców usług chmurowych. NeMo Switchyard jest dostępny na GitHub i wkrótce pojawi się na platformach partnerskich.