NotizieAzioniNVIDIA lancia Nemotron 3.5 Lightning e NeMo Switchyard per un’IA agentica più intelligente ed efficiente

NVIDIA lancia Nemotron 3.5 Lightning e NeMo Switchyard per un’IA agentica più intelligente ed efficiente

Autore: NVIDIA Blog·

Punti chiave

  • Nemotron 3.5 Lightning è un modello open completamente personalizzabile da 30 miliardi di parametri di tipo mixture-of-experts, progettato per attività specializzate ad alto volume nei workflow di IA agentica.
  • NVIDIA afferma che Nemotron 3.5 Lightning offre una velocità di output fino a 4 volte superiore e un completamento delle attività agentiche più rapido del 30% rispetto ad altri modelli della stessa classe.
  • NeMo Switchyard è una libreria open source di routing che indirizza automaticamente ogni prompt al modello più capace ed efficiente, riducendo il costo di completamento delle attività a circa un terzo rispetto all’uso di un singolo modello frontier.
  • Il modello supporta una distribuzione flessibile su sistemi locali, dispositivi edge, workstation, data center e ambienti cloud, consentendo alle organizzazioni di bilanciare latenza, privacy e riutilizzo dell’infrastruttura.
  • NVIDIA sta rilasciando un dataset di reinforcement learning agentico associato, chiamato Nemotron-RL-Agentic-Terminal-Pivot, per supportare il post-addestramento delle capacità di coding agent.
NVIDIA lancia Nemotron 3.5 Lightning e NeMo Switchyard per un’IA agentica più intelligente ed efficiente

Con il passaggio dell’intelligenza artificiale dalle interfacce chatbot agli agenti autonomi, i modelli open source rispondono sempre più alla domanda delle imprese di avere pieno controllo su dove l’IA viene eseguita, su come viene distribuita e su come evolve.

Oggi NVIDIA amplia la famiglia di modelli Nemotron 3 con Nemotron 3.5 Lightning, un modello mixture-of-experts da 30 miliardi di parametri posizionato come il modello più efficiente della sua classe per carichi di lavoro di IA agentica di lunga durata. Questo rilascio segue Nemotron 3 Nano e riflette l’impegno di NVIDIA nel migliorare continuamente i modelli open per aumentare accuratezza e velocità.

Inoltre, NVIDIA sta rilasciando NeMo Switchyard, una libreria open source per il routing intelligente all’interno di strumenti agentici diffusi. Le aziende possono usarla per creare un router basato sulle proprie esigenze specifiche. Una volta distribuito, NeMo Switchyard può indirizzare in modo intelligente ogni richiesta al modello più capace e adatto al compito, senza richiedere agli sviluppatori di riscrivere le applicazioni.

Insieme, Nemotron 3.5 Lightning e NeMo Switchyard offrono un maggiore controllo su come l’IA viene distribuita, dove viene eseguita e quanto efficientemente opera — su PC, workstation, data center e cloud.

Gli agenti sempre attivi richiedono un sistema di modelli

I moderni sistemi agentici — agenti sempre attivi — operano sempre più come sistemi di modelli, o ensemble di modelli, con modelli diversi specializzati in compiti differenti.

I modelli open Nemotron di NVIDIA sono progettati per questa architettura. Un modello di reasoning all’avanguardia come Nemotron 3 Ultra o GPT-5.6 può pianificare e orchestrare un flusso di lavoro, mentre modelli specializzati più piccoli come Nemotron 3.5 Lightning possono svolgere attività mirate come revisione del codice, utilizzo di strumenti, monitoraggio di alert di sicurezza e risposte a domande sulla fatturazione.

Alimentare attività specializzate ad alto volume con Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning è un modello open completamente personalizzabile costruito per attività ad alto volume che alimentano gli agenti sempre attivi. È stato sviluppato con il contributo della Nemotron Coalition, i cui membri hanno fornito metodologie di valutazione, software di inferenza e dataset per contribuire all’avanzamento del modello.

Il modello offre una velocità di output fino a 4 volte superiore, con un completamento delle attività agentiche più rapido del 30% rispetto ad altri modelli della sua classe. E poiché è open e personalizzabile, Nemotron 3.5 Lightning può essere facilmente post-addestrato con NVIDIA NeMo sui dati di dominio, sugli strumenti e sui flussi di lavoro di un’organizzazione, per migliorare l’accuratezza nelle attività specializzate.

I leader dell’IA in diversi settori stanno personalizzando Nemotron 3.5 Lightning per i propri carichi di lavoro, tra cui CrowdStrike per la cybersecurity, Harvey con Trajectory per i servizi legali e CodeRabbit con Baseten per la revisione del codice, contribuendo a migliorare l’accuratezza delle attività agentiche specifiche per dominio. Inoltre, Lila Sciences sta contribuendo a migliorare le capacità di reasoning per attività agentiche nelle scienze fisiche e della vita, e Fastino Labs ha personalizzato il modello e sta osservando accuratezze di riferimento per carichi di lavoro di sviluppo software, finanza e sanità.

Nemotron 3.5 Lightning offre inoltre alle organizzazioni controllo su privacy e distribuzione. Può essere eseguito su sistemi AI locali — inclusi NVIDIA RTX PCs, NVIDIA DGX Spark, NVIDIA DGX Station e NVIDIA Jetson — per aiutare gli utenti a massimizzare gli investimenti nell’infrastruttura esistente, oppure scalare su dispositivi edge AI, workstation NVIDIA RTX PRO, data center e ambienti cloud per casi d’uso aziendali. Inoltre, Nemotron 3.5 Lightning può essere eseguito localmente o on premises per attività specializzate ad alto volume che richiedono risposte rapide.

Inoltre, come per ogni lancio Nemotron, NVIDIA pubblica quanto più possibile dei dati di addestramento e delle tecniche nei limiti consentiti dalla licenza, consentendo tracciabilità, auditing e addestramento di altri modelli. Insieme a Lightning, NVIDIA rilascia anche Nemotron-RL-Agentic-Terminal-Pivot, un dataset di reinforcement learning agentico usato per il post-addestramento delle capacità di coding agent.

App AI più efficienti con il model routing

Alcuni modelli sono migliori per il coding, altri per il reasoning, altri per attività leggere e altri ancora sono ottimizzati per l’esecuzione locale per garantire maggiore privacy ed efficienza. Se i clienti si affidano a un singolo modello predefinito, potrebbero spendere troppo o perdere qualità; se gestiscono il routing manualmente, si crea lavoro di integrazione che può rallentare una distribuzione.

NVIDIA NeMo Switchyard è una libreria open source di model routing per agenti AI. La tecnologia indirizza automaticamente i prompt al modello più capace ed efficiente per ogni fase del flusso di lavoro di un agente, in base a esigenze specifiche. Gli sviluppatori di applicazioni agentiche possono regolare o modificare il router con diversi algoritmi di routing per allinearlo alle proprie priorità, come qualità, latenza e costi. In un sistema di modelli, le aziende possono creare potenti agenti AI con una tokenomics migliorata.

I benchmark interni mostrano che NeMo Switchyard mantiene un’accuratezza da modello frontier riducendo il costo di completamento delle attività a quasi un terzo rispetto a Opus 4.8 da solo.

NVIDIA sta collaborando con partner dell’ecosistema AI per portare il routing intelligente dei modelli negli strumenti e nelle piattaforme che gli sviluppatori già utilizzano.

Boomi: Ha valutato Switchyard su cinque capacità di routing, ottenendo un’accuratezza di routing di dominio del 100%, inviando il 59% del traffico a un modello fine-tuned 5 volte più veloce e riducendo la latenza dei turni successivi del 21%.

Cadence: Ha migliorato l’efficienza del 9,9% usando ChipStack AI Super Agent per un caso d’uso di formal verification.

Classmethod: Sta eseguendo internamente workload opencode e Fireworks usando NeMo Switchyard, con i test iniziali che mostrano una riduzione dei costi del 27% mantenendo la qualità.

Cognition: Ha integrato il router staged di NVIDIA NeMo Switchyard in Devin Desktop per uso interno NVIDIA, ottenendo prestazioni quasi da frontier su FrontierCode Main e riducendo il costo medio del 28% rispetto all’instradamento di tutte le richieste a un singolo modello frontier sottostante.

Kong: Offre il routing con NeMo Switchyard in modo nativo tramite Kong AI Gateway.

LangChain: Con NeMo Switchyard, ha ottenuto un costo inferiore del 74% in 145 attività multi-turn Deep Agents instradando solo il 7% delle chiamate verso un modello frontier, con un compromesso di accuratezza del 6%.

LiteLLM: Sta aggiungendo NeMo Switchyard come plug-in al proprio livello proxy, così gli sviluppatori possono accedere a questi vantaggi senza modificare lo stack esistente.

Nous Research: Ha integrato NeMo Switchyard in Hermes per offrire agli sviluppatori un sistema di routing facile da configurare per migliorare l’efficienza degli agenti.

Ramp: Ha usato NeMo Switchyard per eguagliare le prestazioni di un modello frontier riducendo i costi del 58% e il runtime del 33% in Ramp SWE-Bench.

Siemens: Sta eseguendo benchmark per migliorare l’efficienza del proprio Fuse EDA AI Agent.

Nemotron 3.5 Lightning è disponibile su Hugging Face, ModelScope, OpenRouter e build.nvidia.com come NVIDIA NIM microservice, oltre che attraverso un ampio ecosistema di NVIDIA Cloud Partners, piattaforme di post-training, piattaforme di inferenza e provider di servizi cloud. NeMo Switchyard è disponibile su GitHub e arriverà presto sulle piattaforme dei partner.