NoticiasAccionesNVIDIA lanza Nemotron 3.5 Lightning y NeMo Switchyard para una IA agéntica más inteligente y eficiente

NVIDIA lanza Nemotron 3.5 Lightning y NeMo Switchyard para una IA agéntica más inteligente y eficiente

Autor: NVIDIA Blog·

Puntos clave

  • Nemotron 3.5 Lightning es un modelo abierto y totalmente personalizable de 30.000 millones de parámetros tipo mixture-of-experts, diseñado para tareas especializadas de alto volumen dentro de flujos de trabajo de IA agéntica.
  • NVIDIA informa que Nemotron 3.5 Lightning ofrece hasta 4x mayor velocidad de salida y 30% más rapidez en la finalización de tareas agénticas en comparación con otros modelos de su clase.
  • NeMo Switchyard es una biblioteca de enrutamiento de código abierto que dirige automáticamente cada prompt al modelo más capaz y rentable, reduciendo el costo de finalización de tareas a aproximadamente un tercio del de depender de un solo modelo de frontera.
  • El modelo admite despliegue flexible en sistemas locales, dispositivos de borde, estaciones de trabajo, centros de datos y entornos en la nube, lo que permite equilibrar latencia, privacidad y reutilización de infraestructura.
  • NVIDIA lanza un conjunto de datos de aprendizaje por refuerzo agéntico complementario llamado Nemotron-RL-Agentic-Terminal-Pivot para apoyar el posentrenamiento de capacidades de agente de programación.
NVIDIA lanza Nemotron 3.5 Lightning y NeMo Switchyard para una IA agéntica más inteligente y eficiente

A medida que la inteligencia artificial pasa de las interfaces de chatbot hacia agentes autónomos, los modelos de código abierto atienden cada vez más la demanda empresarial de control sobre el lugar donde se ejecuta la IA, cómo se despliega y cómo evoluciona.

NVIDIA anunció la expansión de su familia de modelos Nemotron 3 con el lanzamiento de Nemotron 3.5 Lightning, un modelo mixture-of-experts de 30.000 millones de parámetros posicionado como la opción de mayor eficiencia de su clase para cargas de trabajo de IA agéntica de larga duración. Este lanzamiento sigue a Nemotron 3 Nano y refleja el esfuerzo continuo de NVIDIA por mejorar los modelos abiertos para lograr mayor precisión y velocidad.

Junto con el nuevo modelo, NVIDIA presenta NeMo Switchyard, una biblioteca de código abierto diseñada para el enrutamiento inteligente dentro de herramientas populares para agentes. La biblioteca permite a las empresas crear enrutadores adaptados a sus necesidades, dirigiendo automáticamente cada solicitud al modelo más capaz y apropiado para la tarea sin necesidad de reescribir aplicaciones.

En conjunto, Nemotron 3.5 Lightning y NeMo Switchyard buscan brindar a las organizaciones mayor control sobre el despliegue de la IA, el lugar donde se ejecuta y su eficiencia operativa en PCs, estaciones de trabajo, centros de datos e infraestructura en la nube, a medida que los sistemas agénticos avanzan más allá de las experiencias de chat con un solo modelo hacia la automatización a nivel de flujo de trabajo.

Los agentes siempre activos necesitan un sistema de modelos

Los sistemas agénticos modernos — definidos como agentes siempre activos — funcionan cada vez más como sistemas de modelos, o conjuntos de modelos, en los que distintos modelos se especializan en diferentes tareas. NVIDIA diseñó sus modelos abiertos Nemotron para esta arquitectura. Un modelo de razonamiento de frontera como Nemotron 3 Ultra o GPT-5.6 puede planificar y orquestar un flujo de trabajo, mientras que modelos más pequeños y especializados como Nemotron 3.5 Lightning pueden ejecutar tareas específicas como revisión de código, uso de herramientas, monitoreo de alertas de seguridad y respuesta a preguntas sobre facturación.

Nemotron 3.5 Lightning: diseñado para tareas especializadas de alto volumen

NVIDIA Nemotron 3.5 Lightning es un modelo abierto totalmente personalizable creado para las tareas de alto volumen que impulsan a los agentes siempre activos. Fue desarrollado con contribuciones del Nemotron Coalition, cuyos miembros aportaron metodologías de evaluación, software de inferencia y conjuntos de datos para ayudar a avanzar el modelo.

El modelo ofrece hasta 4x mayor velocidad de salida, lo que se traduce en una finalización de tareas agénticas 30% más rápida en comparación con otros modelos de su clase. Y, como es abierto y personalizable, Nemotron 3.5 Lightning puede posentrenarse fácilmente con NVIDIA NeMo usando datos de dominio, herramientas y flujos de trabajo propios de una organización para mejorar la precisión en tareas especializadas.

Líderes de IA de distintos sectores están personalizando Nemotron 3.5 Lightning para sus cargas de trabajo, entre ellos CrowdStrike para ciberseguridad, Harvey con Trajectory para servicios legales y CodeRabbit con Baseten para revisión de código, lo que ayuda a mejorar la precisión en tareas agénticas específicas de cada dominio. Además, Lila Sciences está ayudando a mejorar las capacidades de razonamiento para tareas agénticas en ciencias físicas y de la vida, y Fastino Labs personalizó el modelo y está observando precisiones líderes para cargas de trabajo de desarrollo de software, finanzas y salud.

Nemotron 3.5 Lightning también da a las organizaciones control sobre la privacidad y el despliegue. Puede ejecutarse en sistemas locales de IA — incluidos NVIDIA RTX PCs, NVIDIA DGX Spark, NVIDIA DGX Station y NVIDIA Jetson — para ayudar a los usuarios a maximizar las inversiones en infraestructura existente, o escalar en dispositivos de IA en el borde, estaciones de trabajo NVIDIA RTX PRO, centros de datos y entornos en la nube para casos de uso empresariales. Y Nemotron 3.5 Lightning puede ejecutarse localmente o en las instalaciones para tareas especializadas de alto volumen que requieren respuestas rápidas.

Además, como en cada lanzamiento de Nemotron, NVIDIA publica tanta información sobre los datos de entrenamiento y las técnicas como lo permite la licencia, lo que posibilita trazabilidad, auditoría y el entrenamiento de otros modelos. Junto con Lightning, NVIDIA también lanza Nemotron-RL-Agentic-Terminal-Pivot, un conjunto de datos de aprendizaje por refuerzo agéntico utilizado para posentrenarlo para capacidades de agente de programación.

Aplicaciones de IA más eficientes con enrutamiento de modelos

Algunos modelos son mejores para programar, otros para razonar, otros para tareas ligeras y otros están optimizados para ejecutarse localmente con mayor privacidad y eficiencia. Si los clientes dependen de un único modelo predeterminado, pueden gastar de más o perder calidad; si gestionan el enrutamiento manualmente, esto se convierte en trabajo de integración que puede ralentizar un despliegue.

NVIDIA NeMo Switchyard es una biblioteca de enrutamiento de modelos de código abierto para agentes de IA. La tecnología dirige automáticamente los prompts al modelo más capaz y eficiente en cada paso del flujo de trabajo de un agente, en función de necesidades específicas. Los desarrolladores de aplicaciones para agentes pueden ajustar o modificar el enrutador con distintos algoritmos de enrutamiento para alinearlo con prioridades como calidad, latencia y costos. En un sistema de modelos, las empresas pueden crear agentes de IA potentes con una mejor economía de tokens.

Los puntos de referencia internos muestran que NeMo Switchyard mantiene una precisión de nivel de frontera mientras reduce el costo de finalización de tareas a casi un tercio del de usar Opus 4.8 por sí solo.

NVIDIA trabaja con socios de todo el ecosistema de IA para incorporar enrutamiento inteligente de modelos en las herramientas y plataformas que los desarrolladores ya usan.

Boomi: evaluó Switchyard en cinco capacidades de enrutamiento, logrando 100% de precisión en enrutamiento por dominio, enviando 59% del tráfico a un modelo ajustado 5x más rápido y reduciendo la latencia en turnos posteriores en 21%.

Cadence: mejoró la eficiencia en 9.9% usando ChipStack AI Super Agent para un caso de uso de verificación formal.

Classmethod: está ejecutando internamente cargas de trabajo de opencode y Fireworks con NeMo Switchyard, con pruebas iniciales que muestran una reducción de costos de 27% manteniendo la calidad.

Cognition: integró el enrutador por etapas de NVIDIA NeMo Switchyard en Devin Desktop para uso interno de NVIDIA, logrando un rendimiento cercano al de frontera en FrontierCode Main y reduciendo el costo medio en 28% en relación con enrutar todas las solicitudes a un único modelo de frontera subyacente.

Kong: ofrece enrutamiento con NeMo Switchyard de forma nativa a través de Kong AI Gateway.

LangChain: con NeMo Switchyard, logró un costo 74% menor en 145 tareas multi-turno de Deep Agents al enrutar solo 7% de las llamadas a un modelo de frontera, con una compensación de 6% en precisión.

LiteLLM: está agregando NeMo Switchyard como complemento en su capa proxy para que los desarrolladores puedan acceder a estas ventajas sin cambiar su stack existente.

Nous Research: integró NeMo Switchyard en Hermes para proporcionar a los desarrolladores un sistema de enrutamiento fácil de configurar y mejorar la eficiencia de los agentes.

Ramp: utilizó NeMo Switchyard para igualar el rendimiento de un modelo de frontera mientras reducía los costos en 58% y el tiempo de ejecución en 33% en Ramp SWE-Bench.

Siemens: está realizando benchmarking para mejorar la eficiencia de su Fuse EDA AI Agent.

Nemotron 3.5 Lightning está disponible en Hugging Face, ModelScope, OpenRouter y build.nvidia.com como un microservicio NVIDIA NIM, así como a través de un amplio ecosistema de NVIDIA Cloud Partners, plataformas de posentrenamiento, plataformas de inferencia y proveedores de servicios en la nube. NeMo Switchyard está disponible en GitHub y llegará pronto a plataformas de socios.