AktualnościAkcjeNVIDIA rozszerza rodzinę Nemotron 3 o Nemotron 3.5 Lightning, otwarty model MoE o 30 mld parametrów do zadań agentów AI

NVIDIA rozszerza rodzinę Nemotron 3 o Nemotron 3.5 Lightning, otwarty model MoE o 30 mld parametrów do zadań agentów AI

Autor: Hokanews·

Najważniejsze informacje

  • Nemotron 3.5 Lightning wykorzystuje architekturę Mixture-of-Experts z około 3 miliardami aktywnych parametrów na 30 miliardów łącznych parametrów.
  • NVIDIA twierdzi, że model jest zoptymalizowany pod kątem ciągłych, niskolatencyjnych obciążeń agentów, a nie wyłącznie złożonych zadań rozumowania.
  • Firma podaje, że model wykonał 10 000 zadań o 30% szybciej niż Qwen3.6 35B przy podobnej dokładności i osiągnął nawet czterokrotnie wyższą szybkość generowania wyjścia niż porównywalne modele w swojej klasie.
  • NVIDIA udostępnia wagi modelu, dane treningowe i przepisy na licencji OpenMDW-1.1, z obsługą dostrajania za pomocą narzędzi NeMo.
  • NVIDIA wprowadziła również NeMo Switchyard do kierowania pracą między większymi modelami rozumującymi a mniejszymi modelami zorientowanymi na wykonywanie zadań, takimi jak Nemotron 3.5 Lightning.
NVIDIA rozszerza rodzinę Nemotron 3 o Nemotron 3.5 Lightning, otwarty model MoE o 30 mld parametrów do zadań agentów AI

NVIDIA rozszerzyła rodzinę modeli sztucznej inteligencji Nemotron 3 o Nemotron 3.5 Lightning, otwarty model Mixture-of-Experts (MoE) o 30 miliardach parametrów, zaprojektowany specjalnie do wysokowęzłowych zadań agentów AI.

Nowy model jest skierowany do rosnącej klasy zastosowań AI, które działają nieprzerwanie, wykonując zadania takie jak wywołania narzędzi, przetwarzanie danych, operacje programowe, walidacja wyników oraz komunikacja między różnymi systemami AI. NVIDIA podaje, że Nemotron 3.5 Lightning może dostarczać nawet czterokrotnie wyższą szybkość generowania wyjścia niż porównywalne modele w swojej klasie, a także wykonywać duże partie zadań agentowych nawet o 30% szybciej przy podobnym poziomie dokładności.

Ogłoszenie dodaje kolejny wymiar do rozbudowywanej strategii AI NVIDIA. Firma nie koncentruje się już wyłącznie na dostarczaniu procesorów do uruchamiania systemów sztucznej inteligencji; coraz częściej tworzy modele, oprogramowanie i narzędzia, które mają pomagać firmom budować i wdrażać aplikacje AI na sprzęcie NVIDIA. To pozycjonuje NVIDIA nie tylko wobec producentów układów scalonych, takich jak AMD i Intel, ale także wobec dostawców modeli, takich jak Meta (Llama), Alibaba (Qwen), Mistral AI i Google (Gemma), na rynku otwartych modeli AI.

NVIDIA celuje w kolejny etap rozwoju agentów AI

Najnowszy model Nemotron pojawia się w momencie, gdy agenci AI stają się jednym z głównych obszarów zainteresowania w branży technologicznej. Tradycyjni asystenci AI zwykle odpowiadają na pojedyncze polecenia, podczas gdy agent może rozbić większy cel na wiele działań, korzystać z zewnętrznych narzędzi, pobierać informacje, wykonywać polecenia i oceniać wyniki przed kontynuacją. Firmy, w tym OpenAI, Anthropic, Google i Microsoft, sygnalizowały już, że agentowa AI — systemy działające z większą autonomią — stanowi ważny kierunek rozwoju.

Takie systemy mogą generować bardzo dużą liczbę wywołań modeli. Na przykład agent AI do programowania może wielokrotnie analizować pliki, wykonywać polecenia, sprawdzać błędy, modyfikować kod i uruchamiać testy, zanim zakończy jedno zadanie. Każdy pojedynczy krok nie musi wymagać najmocniejszego dostępnego modelu rozumującego — zamiast tego deweloperzy mogą preferować mniejszy model zdolny do szybkiego i wydajnego wykonywania powtarzalnych zadań.

To właśnie ten rynek NVIDIA celuje obsłużyć za pomocą Nemotron 3.5 Lightning. Firma twierdzi, że model jest zoptymalizowany pod wysokowolumenowe, niskolatencyjne wykonywanie zadań, a nie wyłącznie pod najbardziej złożone zadania rozumowania.

Model o 30 miliardach parametrów z 3 miliardami aktywnych parametrów

Kluczową cechą techniczną Nemotron 3.5 Lightning jest architektura Mixture-of-Experts. Choć model zawiera łącznie 30 miliardów parametrów, NVIDIA podaje, że podczas pojedynczego przebiegu aktywnych jest około 3 miliardów parametrów. Pozwala to modelowi zachować możliwości znacznie większego systemu, jednocześnie zmniejszając ilość obliczeń potrzebnych na każdy token. Architektury MoE zyskały popularność w całej branży, a modele takie jak DeepSeek-V3, Mistral Mixtral i xAI Grok stosują podobne podejścia, aby zwiększać liczbę parametrów bez proporcjonalnego wzrostu kosztów obliczeniowych inferencji.

W tradycyjnym gęstym modelu zasadniczo cały zestaw parametrów uczestniczy w przetwarzaniu każdego wejścia. Model MoE działa inaczej: system routingu określa, którzy eksperci powinni obsłużyć dany token lub fragment zadania. Aktywowani są tylko wybrani eksperci, co pozwala zmniejszyć obliczenia przy zachowaniu dużej łącznej puli parametrów.

NVIDIA podaje, że taka konstrukcja sprawia, iż Nemotron 3.5 Lightning nadaje się do wysokowolumenowych obciążeń, w których szybkość i wydajność mają kluczowe znaczenie. Przy 30 miliardach parametrów łącznie i 3 miliardach aktywnych parametrów model należy do mniejszych członków szerszej rodziny Nemotron 3, zachowując jednocześnie możliwości przeznaczone do zaawansowanych workflowów agentowych.

Zbudowany dla AI działającej stale

Pojęcie „always-on AI agents” jest centralne dla sposobu, w jaki NVIDIA pozycjonuje nowy model. Firma argumentuje, że działające długo agenty spędzają większość czasu na wykonywaniu stosunkowo rutynowych operacji, a nie na złożonym rozumowaniu. Do takich operacji mogą należeć wywołania narzędzi, walidacja wyników, formatowanie informacji, pobieranie plików i delegowanie zadań do innych modeli.

Uruchamianie dużego modelu rozumującego dla każdej pojedynczej operacji mogłoby zwiększać zarówno opóźnienia, jak i koszty obliczeniowe. Podejście NVIDIA polega na podziale obciążenia między różne modele: większy model może zajmować się planowaniem strategicznym i złożonym rozumowaniem, podczas gdy Nemotron 3.5 Lightning obsługuje powtarzalne kroki wykonawcze. NVIDIA opisuje to jako „system modeli”, a nie pojedynczy model odpowiedzialny za każde zadanie.

Szybkość jako kluczowa cecha

NVIDIA podkreśla szybkość inferencji jako jedną z definiujących cech Nemotron 3.5 Lightning. Firma podaje, że w PinchBench model osiągnął 86% dokładności, wykonując 10 000 zadań o 30% szybciej niż Qwen3.6 35B przy podobnej dokładności. NVIDIA informuje również, że Nemotron 3.5 Lightning osiąga granicę Pareto dokładności i szybkości w Artificial Analysis Intelligence Index.

Te dane są wynikami raportowanymi przez NVIDIA, a nie niezależnym potwierdzeniem. Mimo to nacisk na przepustowość odzwierciedla kierunek rynku AI. W miarę przechodzenia AI do środowisk produkcyjnych deweloperzy coraz bardziej zwracają uwagę na to, jak szybko i efektywnie modele mogą wykonywać rzeczywiste obciążenia, a nie tylko na to, jak wypadają w pojedynczych testach benchmarkowych.

Dlaczego wydajność inferencji ma znaczenie

Trenowanie dużych modeli AI przyciąga dużą uwagę ze względu na ogromne zasoby obliczeniowe, których wymaga, ale inferencja staje się równie ważną częścią gospodarki AI. Według szacunków analityków branżowych inferencja odpowiada już za znaczną i rosnącą część całkowitych wydatków na obliczenia AI, ponieważ modele przechodzą z fazy rozwoju do produkcyjnych wdrożeń obsługujących miliardy zapytań. Za każdym razem, gdy system AI odpowiada na żądanie, generuje kod, pobiera informacje lub kończy zautomatyzowane zadanie, zużywane są zasoby obliczeniowe. W przypadku agenta AI działającego nieprzerwanie koszty te mogą szybko się kumulować.

Model, który generuje odpowiedzi szybciej i wymaga mniejszej liczby aktywnych parametrów, może potencjalnie zmniejszyć ilość infrastruktury obliczeniowej potrzebnej do danego obciążenia. Najnowszy model NVIDIA odpowiada na praktyczny problem: jak sprawić, by autonomiczne systemy AI działały stale, nie czyniąc każdego pojedynczego zadania niepotrzebnie kosztownym.

Personalizacja i otwarte wagi

NVIDIA pozycjonuje Nemotron 3.5 Lightning jako model konfigurowalny. Deweloperzy otrzymują wagi modelu, dane treningowe i przepisy w ramach liberalnej struktury licencyjnej OpenMDW-1.1, co pozwala im dostosowywać model do konkretnych zastosowań. NVIDIA twierdzi, że model można dostrajać za pomocą LoRA lub pełnego supervised fine-tuning przy użyciu narzędzi NeMo, a deweloperzy mogą też korzystać z uczenia ze wzmocnieniem i ewaluacji opartych na środowisku.

Premiera odzwierciedla dalsze wejście NVIDIA w otwarte modele z wagami. Zamiast zmuszać deweloperów do korzystania z modelu wyłącznie poprzez zastrzeżone API, otwarte modele zapewniają większą kontrolę nad wdrażaniem. Organizacje mogą uruchamiać modele na własnej infrastrukturze, dostosowywać je do konkretnych przypadków użycia i integrować z istniejącymi systemami AI — co może być szczególnie ważne dla firm pracujących z wrażliwymi danymi. Takie podejście wpisuje się w szerszy trend branżowy: modele Llama firmy Meta, seria Qwen firmy Alibaba, wydania Mistral AI oraz linia Gemma firmy Google pokazują duże zapotrzebowanie na modele AI, które można pobierać i modyfikować.

Zaprojektowany do wdrożeń lokalnych i w centrach danych

Zgodnie z dokumentacją modelu NVIDIA, Nemotron 3.5 Lightning może działać na pojedynczym systemie DGX Spark lub karcie H100 GPU w określonych konfiguracjach. Jest też wspierany na sprzęcie NVIDIA Blackwell oraz GPU generacji Hopper, a dodatkowe opcje wdrożenia są dostępne poprzez obsługiwane frameworki inferencyjne. Taka elastyczność sprawia, że model nadaje się zarówno dla deweloperów eksperymentujących z agentami autonomicznymi na systemach lokalnych, jak i dla firm prowadzących duże środowiska produkcyjne.

Architektura hybrydowa

Nemotron 3.5 Lightning nie opiera się wyłącznie na konwencjonalnej architekturze Transformer. NVIDIA opisuje go jako system hybrydowy łączący Mamba-2, warstwy Mixture-of-Experts oraz wybrane warstwy attention. Architektura ma równoważyć wydajność obliczeniową ze zdolnością przetwarzania złożonych sekwencji. Komponenty w stylu Mamba mogą zmniejszać niektóre wymagania pamięciowe podczas przetwarzania sekwencji, natomiast warstwy MoE pozwalają zwiększać całkowitą liczbę parametrów bez aktywowania wszystkich parametrów dla każdego tokena. Warstwy attention nadal pozostają ważne w zadaniach wymagających szczegółowych zależności między tokenami. Dzięki połączeniu tych podejść NVIDIA próbuje stworzyć model, który zapewni wysoką przepustowość bez utraty możliwości potrzebnych w workflowach agentowych.

Długość kontekstu sięga 1 miliona tokenów

Kolejną istotną specyfikacją jest pojemność kontekstu modelu. Dokumentacja NVIDIA wskazuje obsługę długości kontekstu do 1 miliona tokenów. Duże okno kontekstowe może być przydatne dla agentów AI, które muszą przetwarzać rozbudowane dokumenty, repozytoria kodu źródłowego, logi lub długotrwałą historię zadań. Agent pracujący nad dużym projektem programistycznym może na przykład potrzebować dostępu do wielu plików i wcześniejszych interakcji. Dłuższy kontekst może zmniejszyć potrzebę wielokrotnego streszczania lub odrzucania informacji.

Nie oznacza to jednak automatycznie, że każda aplikacja skorzysta z tego w równym stopniu. Rzeczywista wydajność zależy od obciążenia, konfiguracji inferencji i sprzętu. Niemniej jednak ta funkcja pokazuje, że NVIDIA koncentruje się na systemach AI zaprojektowanych do pracy z długimi i złożonymi zadaniami.

Źródło: Xpost

Nemotron 3.5 Lightning dołącza do rosnącej rodziny

Najnowsze wydanie rozszerza już szerszą rodzinę Nemotron 3. NVIDIA wcześniej wprowadziła wiele modeli zaprojektowanych do różnych poziomów obciążeń AI, w tym mniejsze modele do wydajnego wykonywania zadań oraz większe systemy do złożonego rozumowania i aplikacji wieloagentowych. Strategia firmy coraz bardziej opiera się na specjalizacji. Zamiast zakładać, że jeden model powinien obsługiwać każde zadanie, NVIDIA buduje zestaw modeli o różnych mocnych stronach.

Nemotron 3.5 Lightning jest pozycjonowany po stronie wysokowolumenowego wykonywania zadań w tym spektrum, co może czynić go uzupełnieniem większych systemów rozumujących, a nie ich bezpośrednim zastępstwem.

NVIDIA wprowadza routing modeli z NeMo Switchyard

Wraz z nowym modelem NVIDIA promuje NeMo Switchyard, bibliotekę zaprojektowaną do kierowania zadań do różnych modeli. System może określić, czy dane zadanie wymaga mocnego modelu rozumującego, czy też mniejszy i szybszy model może je wykonać. Na przykład złożone zadanie planowania można wysłać do systemu rozumowania na granicy możliwości, podczas gdy powtarzalne zadania wykonawcze mogą trafić do Nemotron 3.5 Lightning. NVIDIA podaje, że Switchyard pozwala deweloperom udostępniać Lightning obok modeli otwartych i zamkniętych oraz kierować pojedyncze zapytania zgodnie z ich wymaganiami.

Jeśli takie podejście do routingu modeli upowszechni się, aplikacje AI mogą coraz częściej działać jako sieci wyspecjalizowanych modeli. Podobne koncepcje routingu były badane przez platformy takie jak rodzina modeli OpenAI oraz różne frameworki orkiestracji open source.

Ekonomia agentów AI

Ekonomia agentów AI może stać się jednym z najważniejszych tematów kolejnej fazy branży. Chatbot może odpowiedzieć użytkownikowi raz, ale autonomiczny agent może wykonać setki lub tysiące operacji, by osiągnąć jeden cel. Jeśli deweloper może używać mniejszego modelu do rutynowych zadań, a droższe modele rozumujące rezerwować do trudnych decyzji, całkowity koszt systemu AI może potencjalnie spaść. NVIDIA stawia na to, że taki podział pracy stanie się standardową architekturą dla dużych systemów agentowych.

Nemotron 3.5 Lightning został zaprojektowany właśnie do takiej roli.

Programowanie jako główny przypadek użycia

Tworzenie oprogramowania to jeden z obszarów, w których agenci AI stają się coraz bardziej aktywni. Agenci do kodowania mogą analizować repozytoria, pisać programy, uruchamiać testy, identyfikować błędy i wprowadzać poprawki. Takie workflowy obejmują wielokrotne interakcje z narzędziami. Model zoptymalizowany pod szybkie wykonywanie zadań może więc bezpośrednio wpływać na szybkość działania agenta programistycznego.

Dokumentacja NVIDIA wymienia kodowanie i obciążenia agentowe wśród docelowych zastosowań modelu, w tym tworzenie oprogramowania i scenariusze użycia narzędzi. Firma podaje również, że model był trenowany na danych obejmujących kodowanie, wywoływanie narzędzi, ustrukturyzowane wyjścia i wieloetapowe workflowy.

To ukierunkowanie odróżnia model od systemów projektowanych głównie do klasycznych zastosowań konwersacyjnych.

Zastosowania korporacyjne mogą być istotne

Firmy są również ważnym celem dla Nemotron 3.5 Lightning. Przedsiębiorstwa testują agentów AI do obsługi klienta, badań wewnętrznych, przetwarzania dokumentów, operacji IT, tworzenia oprogramowania i automatyzacji workflowów. Wiele z tych zastosowań obejmuje powtarzalne kroki. Agent obsługi klienta może pobierać dane konta, weryfikować żądanie i aktualizować rekordy. Agent badań wewnętrznych może zbierać dokumenty, porządkować informacje i przekazywać wyniki do innego modelu. Agent IT może wykonywać polecenia i sprawdzać, czy żądana zmiana zakończyła się powodzeniem.

Zadania te nie zawsze wymagają najgłębszego możliwego rozumowania. Wymagają natomiast niezawodności i szybkości. To właśnie w takim obszarze NVIDIA widzi miejsce dla modelu takiego jak Nemotron 3.5 Lightning.

Szersza strategia AI NVIDIA

Premiera pokazuje, jak działalność AI NVIDIA wykracza poza GPU. Firma pozostaje jednym z najważniejszych na świecie dostawców przyspieszonego sprzętu obliczeniowego, ale jej strategia coraz częściej obejmuje warstwy oprogramowania i modeli budowane na tym sprzęcie. Udostępniając otwarte modele i narzędzia deweloperskie, NVIDIA może zachęcać twórców do budowania systemów AI, które ostatecznie działają na infrastrukturze NVIDIA. Nemotron jest częścią szerszego wysiłku, aby ustanowić NVIDIA jako pełnostackową platformę AI.

Konkurencja na rynku otwartych modeli AI się zaostrza

NVIDIA wchodzi na wysoce konkurencyjny rynek otwartych modeli. Deweloperzy mają dostęp do modeli wielu firm technologicznych i organizacji badawczych. Konkurencja nie dotyczy już wyłącznie liczby parametrów. Deweloperzy oceniają modele również pod kątem szybkości inferencji, dokładności, długości kontekstu, licencji, możliwości dostosowania, wymagań sprzętowych i obsługi narzędzi.

Model, który jest nieco mniej zaawansowany, ale znacznie szybszy, może być bardziej użyteczny w produkcyjnym agencie AI. Właśnie ten rynek NVIDIA chce obsłużyć za pomocą Nemotron 3.5 Lightning.

Jego wartość ostatecznie zależeć będzie od tego, czy deweloperzy uznają jego wydajność i możliwości dostosowania za atrakcyjne na tle konkurencyjnych otwartych modeli.

Co odróżnia model Lightning?

Najważniejszą różnicą jest przeznaczone obciążenie. Nemotron 3.5 Lightning nie jest pozycjonowany jako jeden model do wykonywania wszystkich zadań AI. NVIDIA widzi go raczej jako wydajnego „konia roboczego”. Model może wykonywać rutynowe operacje na dużą skalę, podczas gdy większe modele rozumujące koncentrują się na decyzjach strategicznych.

Przypomina to sposób, w jaki tradycyjne systemy oprogramowania rozdzielają obciążenia między wyspecjalizowane komponenty. Różnica polega na tym, że modele AI mogą teraz dynamicznie dzielić zadania według złożoności. To może zwiększyć efektywność systemów AI wraz z ich skalowaniem.

Deklaracje wydajności NVIDIA wymagają niezależnej oceny

Deklaracje NVIDIA dotyczące nawet czterokrotnie szybszego generowania tokenów i 30% szybszego ukończenia zadań są ważne, ale należy patrzeć na nie w odpowiednim kontekście. Wyniki benchmarków mogą się różnić w zależności od sprzętu, konfiguracji oprogramowania, wielkości paczki, długości sekwencji i modeli konkurencyjnych.

NVIDIA podaje, że Nemotron 3.5 Lightning osiąga granicę Pareto dokładności i szybkości w Artificial Analysis Intelligence Index oraz uzyskuje wynik 86% w PinchBench, kończąc 10 000 zadań szybciej niż wskazany konkurencyjny model. Niezależni deweloperzy i badacze ostatecznie zapewnią pełniejszy obraz, gdy model będzie wykorzystywany w różnych obciążeniach.

Udostępnienie wag modelu i dokumentacji powinno ułatwić takie testy.

Ekosystem modeli otwartych może na tym zyskać

Udostępnienia otwartych wag pozwalają badaczom i deweloperom analizować wydajność modeli poza kontrolowanymi prezentacjami producenta. Może to prowadzić do większej liczby porównań, eksperymentów z dostrajaniem i zastosowań specjalistycznych.

Wydanie NVIDIA obejmuje wagi modelu i dodatkowe zasoby przeznaczone do wspierania personalizacji. Firma udostępnia również ścieżki integracji dla frameworków inferencyjnych i platform sprzętowych. To może przyspieszyć adopcję wśród deweloperów, którzy chcą eksperymentować z systemami agentowymi bez budowania modelu od zera.

Co to oznacza dla inwestorów NVIDIA

Dla inwestorów obserwujących akcje NVDA premiera Nemotron 3.5 Lightning prawdopodobnie nie będzie miała takiego natychmiastowego znaczenia finansowego jak ważne ogłoszenie produktu GPU. Pokazuje jednak ważny trend strategiczny. NVIDIA stara się uczynić swój stos technologiczny coraz bardziej centralnym elementem rozwoju AI.

Jeśli deweloperzy będą korzystać łącznie z modeli NVIDIA, bibliotek optymalizacyjnych i sprzętu, firma może czerpać korzyści z wielu warstw ekosystemu AI. Sam model może nie być głównym źródłem przychodów. Jego wartość strategiczna może wynikać przede wszystkim ze wzmocnienia pozycji NVIDIA jako platformy, na której są tworzone i wdrażane aplikacje AI.

Następna faza AI może dotyczyć wydajności

Pierwszą fazę generatywnej AI zdominowała skala modeli. Firmy rywalizowały o budowę coraz większych systemów o lepszych zdolnościach rozumowania. Kolejna faza może być bardziej skoncentrowana na wydajności.

Firmy potrzebują AI działającej stale. Potrzebują przewidywalnych kosztów. Potrzebują szybkich odpowiedzi. Potrzebują systemów, które można integrować z narzędziami programowymi i danymi wewnętrznymi. I potrzebują modeli, które można dostosować do specjalistycznych zadań.

Nemotron 3.5 Lightning odzwierciedla tę zmianę. Architektura z 30 miliardami parametrów, konstrukcja z 3 miliardami aktywnych parametrów oraz nacisk na wysokowolumenowe wykonywanie zadań agentowych mają sprawić, że AI stanie się praktyczna na dużą skalę.

Coin Bureau i szersza dyskusja o AI

Premiera przyciągnęła też uwagę w społecznościach mediów społecznościowych skupionych na technologii i kryptowalutach, w tym w dyskusjach powiązanych z kontem Coin Bureau. Jednak główne informacje techniczne w tym materiale pochodzą z własnego ogłoszenia NVIDIA i dokumentacji modelu. Nie udało się niezależnie potwierdzić konkretnego wpisu Coin Bureau potwierdzającego deklaracje wydajności, więc te deklaracje są przypisywane NVIDIA, a nie przedstawiane jako niezależnie zweryfikowane przez Coin Bureau.

To rozróżnienie jest istotne, ponieważ firmy AI coraz częściej publikują dane wydajnościowe, które mogą różnić się w zależności od warunków testowych.

Co dalej z Nemotron

Najważniejszym testem dla Nemotron 3.5 Lightning będzie rzeczywista adopcja. Deweloperzy ocenią, jak łatwo model można zintegrować z istniejącymi frameworkami agentowymi. Firmy sprawdzą jego niezawodność i możliwości dostosowania. Badacze porównają jego wydajność z innymi otwartymi modelami. Dostawcy infrastruktury określą, jak efektywnie może działać w różnych skalach.

Jeśli deweloperzy uznają, że model może niezawodnie obsługiwać duże liczby rutynowych zadań agentowych, zachowując wysoką dokładność, NVIDIA może zyskać nowy, silny komponent dla rozwijającej się gospodarki agentów.

Szerszy obraz

Premiera Nemotron 3.5 Lightning odzwierciedla szerszą transformację w sztucznej inteligencji. AI przechodzi od systemów, które tylko odpowiadają na pytania, do systemów, które wykonują pracę. Taka zmiana wymaga modeli zdolnych do ciągłego działania, interakcji z narzędziami programowymi i obsługi dużej liczby pojedynczych działań.

Najmocniejszy model rozumujący nie zawsze będzie najlepszym wyborem do takich zadań. Czasem większe znaczenie mają szybkość, efektywność i możliwość dostosowania. NVIDIA pozycjonuje Nemotron 3.5 Lightning właśnie wokół tej idei.

Model łączy dużą łączną pulę parametrów z rzadką aktywacją, architekturą hybrydową, obsługą długiego kontekstu i narzędziami do personalizacji. Jego celem nie jest koniecznie zastąpienie największych modeli AI. Zamiast tego ma działać obok nich.

Podsumowanie

NVIDIA rozszerzyła rodzinę Nemotron 3 o Nemotron 3.5 Lightning, otwarty model Mixture-of-Experts o 30 miliardach parametrów i około 3 miliardach aktywnych parametrów.

Model został zaprojektowany specjalnie do wysokowolumenowego wykonywania zadań w stale działających agentach AI, w tym wywołań narzędzi, workflowów programistycznych, walidacji wyników i innych powtarzalnych zadań.

NVIDIA podaje, że Nemotron 3.5 Lightning może osiągać nawet czterokrotnie wyższą szybkość generowania wyjścia niż porównywalne modele i wykonywać 10 000 zadań agentowych o 30% szybciej niż wskazany konkurencyjny model przy podobnej dokładności. Dane te pozostają deklaracjami wydajności przekazywanymi przez producenta i powinny być oceniane niezależnie na różnych platformach sprzętowych i w różnych obciążeniach.

Model wspiera też personalizację, a NVIDIA udostępnia wagi i zasoby treningowe, które deweloperzy mogą wykorzystać do dostrajania i uczenia ze wzmocnieniem. Jego architektura łączy komponenty Mamba-2, MoE i attention, a model obsługuje długości kontekstu do 1 miliona tokenów.

Szersze znaczenie premiery może leżeć w jej nacisku na wydajność. W miarę jak agenci AI stają się bardziej autonomiczni i mają wykonywać tysiące pojedynczych operacji, proponowane przez NVIDIA rozwiązanie polega na podziale pracy. Duże modele rozumujące zajmują się złożonym planowaniem, a mniejsze wyspecjalizowane modele, takie jak Nemotron 3.5 Lightning, szybko wykonują rutynowe zadania.

Taka strategia routingu modeli, wspierana przez NeMo Switchyard, może stać się ważną częścią architektury AI w przedsiębiorstwach.