NVIDIA Amplía la Familia Nemotron 3 con Nemotron 3.5 Lightning, un Modelo MoE Abierto de 30B Parámetros para Cargas de Trabajo de Agentes de IA
Puntos clave
- •Nemotron 3.5 Lightning utiliza un diseño Mixture-of-Experts con alrededor de 3.000 millones de parámetros activos de 30.000 millones en total.
- •NVIDIA afirma que el modelo está optimizado para cargas de trabajo de agentes siempre activos y de baja latencia, no solo para tareas complejas de razonamiento.
- •La compañía reporta que el modelo fue 30% más rápido que Qwen3.6 35B en 10,000 tareas con precisión similar y que alcanzó hasta cuatro veces la velocidad de salida de modelos comparables de su clase.
- •NVIDIA publicará los pesos, los datos de entrenamiento y las recetas del modelo bajo una licencia OpenMDW-1.1, con soporte para ajuste fino mediante herramientas NeMo.
- •NVIDIA también presentó NeMo Switchyard para enrutar el trabajo entre modelos de razonamiento más grandes y modelos de ejecución más pequeños como Nemotron 3.5 Lightning.

NVIDIA ha ampliado su familia Nemotron 3 de modelos de inteligencia artificial con el lanzamiento de Nemotron 3.5 Lightning, un modelo abierto Mixture-of-Experts (MoE) de 30.000 millones de parámetros diseñado específicamente para cargas de trabajo de agentes de IA de alto volumen.
El nuevo modelo apunta a una clase creciente de aplicaciones de IA que operan de forma continua, encargándose de tareas como llamadas a herramientas, procesamiento de datos, operaciones de software, validación de resultados y comunicación entre distintos sistemas de IA. NVIDIA indica que Nemotron 3.5 Lightning puede ofrecer hasta cuatro veces la velocidad de salida de modelos comparables de su clase, al mismo tiempo que completa grandes lotes de tareas agénticas hasta 30% más rápido con niveles similares de precisión.
El anuncio añade otra dimensión a la estrategia de IA en expansión de NVIDIA. La compañía ya no se centra únicamente en suministrar procesadores para ejecutar sistemas de IA; cada vez más desarrolla modelos, software y herramientas diseñados para ayudar a las empresas a construir y desplegar aplicaciones de IA sobre hardware de NVIDIA. Esto posiciona a NVIDIA no solo frente a fabricantes de chips como AMD e Intel, sino también frente a proveedores de modelos como Meta (Llama), Alibaba (Qwen), Mistral AI y Google (Gemma) en el mercado de IA de peso abierto.
NVIDIA Apunta a la Próxima Etapa de los Agentes de IA
El último modelo Nemotron llega en un momento en que los agentes de IA se han convertido en un foco importante dentro de la industria tecnológica. Los asistentes de IA tradicionales suelen responder a indicaciones individuales, mientras que un agente puede descomponer un objetivo mayor en múltiples acciones, usar herramientas externas, recuperar información, ejecutar comandos y evaluar los resultados antes de continuar. Empresas como OpenAI, Anthropic, Google y Microsoft han señalado que la IA agéntica —sistemas que actúan con mayor autonomía— representa una frontera clave.
Estos sistemas pueden generar un número muy elevado de llamadas al modelo. Un agente de programación con IA, por ejemplo, puede necesitar inspeccionar archivos, ejecutar comandos, revisar errores, modificar código y ejecutar pruebas repetidamente antes de completar una sola tarea. Cada paso individual puede no requerir el modelo de razonamiento más potente disponible; en cambio, los desarrolladores pueden preferir un modelo más pequeño capaz de realizar tareas repetitivas de forma rápida y eficiente.
Ese es el mercado al que NVIDIA apunta con Nemotron 3.5 Lightning. La compañía afirma que el modelo está optimizado para una ejecución de alto volumen y baja latencia, en lugar de usarse exclusivamente para las cargas de trabajo de razonamiento más complejas.
Un Modelo de 30.000 Millones de Parámetros con 3.000 Millones de Parámetros Activos
Una característica técnica clave de Nemotron 3.5 Lightning es su arquitectura Mixture-of-Experts. Aunque el modelo contiene 30.000 millones de parámetros en total, NVIDIA señala que solo aproximadamente 3.000 millones de parámetros están activos durante un pase hacia adelante determinado. Esto permite que el modelo mantenga la capacidad de un sistema sustancialmente más grande mientras reduce la cantidad de cómputo necesaria para cada token. Las arquitecturas MoE han ganado tracción en toda la industria, con modelos como DeepSeek-V3, Mixtral de Mistral y Grok de xAI adoptando enfoques similares para escalar el número de parámetros sin incrementar proporcionalmente el cómputo de inferencia.
En un modelo denso tradicional, prácticamente todo el conjunto de parámetros participa en el procesamiento de cada entrada. Un modelo MoE funciona de manera distinta: un sistema de enrutamiento determina qué expertos deben manejar un token o una parte específica de una tarea. Solo se activan los expertos seleccionados, lo que permite reducir el cómputo manteniendo un gran grupo total de parámetros.
NVIDIA afirma que este diseño hace que Nemotron 3.5 Lightning sea adecuado para cargas de alto volumen donde la velocidad y la eficiencia son críticas. Con 30.000 millones de parámetros totales y 3.000 millones de parámetros activos, se ubica entre los miembros más pequeños de la familia Nemotron 3 más amplia, sin dejar de conservar capacidades pensadas para flujos de trabajo agénticos sofisticados.
Diseñado para IA Siempre Activa
El concepto de "agentes de IA siempre activos" es central en la forma en que NVIDIA posiciona el nuevo modelo. La compañía sostiene que los agentes de larga duración pasan gran parte de su tiempo realizando operaciones relativamente rutinarias en lugar de razonamiento complejo. Esas operaciones pueden incluir llamadas a herramientas, validación de resultados, formateo de información, recuperación de archivos y delegación de tareas a otros modelos.
Ejecutar un gran modelo de razonamiento de frontera para cada operación individual podría aumentar tanto la latencia como los costos de cómputo. El enfoque de NVIDIA es dividir la carga de trabajo entre distintos modelos: un modelo más grande puede encargarse de la planificación estratégica y del razonamiento complejo, mientras que Nemotron 3.5 Lightning se ocupa de los pasos repetitivos de ejecución. NVIDIA describe esto como un "sistema de modelos" más que como un único modelo responsable de cada tarea.
La Velocidad es una Característica Central
NVIDIA está destacando la velocidad de inferencia como una de las características definitorias de Nemotron 3.5 Lightning. La compañía informa que, en PinchBench, el modelo alcanzó 86% de precisión mientras completaba 10,000 tareas 30% más rápido que Qwen3.6 35B con una precisión similar. NVIDIA también informa que Nemotron 3.5 Lightning alcanza la frontera de Pareto de precisión-velocidad en el Artificial Analysis Intelligence Index.
Estas cifras son resultados reportados por NVIDIA y no una confirmación independiente. Aun así, el énfasis en el rendimiento refleja la dirección del mercado de IA. A medida que la IA avanza hacia entornos de producción, los desarrolladores se preocupan cada vez más por qué tan rápido y eficientemente los modelos pueden completar cargas de trabajo reales, y no solo por su desempeño en preguntas individuales de referencia.
Por Qué Importa la Eficiencia de Inferencia
Entrenar grandes modelos de IA atrae mucha atención debido a los enormes recursos de cómputo que requiere, pero la inferencia se está convirtiendo en una parte igualmente importante de la economía de la IA. Los analistas de la industria han estimado que la inferencia ya representa una parte significativa y creciente del gasto total en cómputo de IA, a medida que los modelos pasan del desarrollo a la producción en vivo atendiendo miles de millones de consultas. Cada vez que un sistema de IA responde a una solicitud, genera código, recupera información o completa una tarea automatizada, consume recursos de cómputo. En un agente de IA que opera de forma continua, esos costos pueden acumularse rápidamente.
Un modelo que produce respuestas más rápido y requiere menos parámetros activos puede reducir potencialmente la infraestructura de cómputo necesaria para una carga de trabajo determinada. El último modelo de NVIDIA aborda un problema práctico: cómo hacer que los sistemas autónomos de IA operen de forma continua sin que cada tarea individual resulte innecesariamente costosa.
La Personalización y la IA de Peso Abierto
NVIDIA también está posicionando Nemotron 3.5 Lightning como un modelo personalizable. La compañía afirma que los desarrolladores reciben los pesos del modelo, los datos de entrenamiento y las recetas bajo una estructura de licencia OpenMDW-1.1 permisiva, lo que les permite adaptar el modelo a aplicaciones específicas. NVIDIA dice que el modelo puede ajustarse mediante LoRA o mediante ajuste supervisado completo a través de las herramientas NeMo de NVIDIA, y que los desarrolladores también pueden usar aprendizaje por refuerzo y evaluaciones basadas en entornos.
El lanzamiento refleja el impulso continuo de NVIDIA hacia la IA de peso abierto. En lugar de obligar a los desarrolladores a acceder a un modelo exclusivamente a través de una API propietaria, los modelos de peso abierto ofrecen más control sobre el despliegue. Las organizaciones pueden ejecutar modelos en su propia infraestructura, ajustarlos para casos de uso específicos e integrarlos en sistemas de IA existentes, un enfoque que puede ser especialmente importante para empresas que manejan información sensible. Este enfoque se alinea con una tendencia más amplia de la industria: los modelos Llama de Meta, la serie Qwen de Alibaba, los lanzamientos de Mistral AI y la línea Gemma de Google han demostrado una fuerte demanda de modelos de IA descargables y modificables.
Diseñado para Despliegue Local y en Centros de Datos
Según la documentación del modelo de NVIDIA, Nemotron 3.5 Lightning puede ejecutarse en un solo sistema DGX Spark o en una GPU H100 bajo ciertas configuraciones. También cuenta con soporte en el hardware Blackwell de NVIDIA y en GPUs de la generación Hopper, con opciones adicionales de despliegue disponibles mediante marcos de inferencia compatibles. Esa flexibilidad hace que el modelo sea adecuado tanto para desarrolladores que experimentan con agentes autónomos en sistemas locales como para empresas que operan grandes entornos de producción.
Una Arquitectura Híbrida
Nemotron 3.5 Lightning no depende exclusivamente de una arquitectura Transformer convencional. NVIDIA lo describe como un sistema híbrido que combina Mamba-2, capas Mixture-of-Experts y capas de atención seleccionadas. La arquitectura está pensada para equilibrar la eficiencia de cómputo con la capacidad de procesar secuencias complejas. Los componentes de estilo Mamba pueden reducir ciertos requisitos de memoria durante el procesamiento de secuencias, mientras que las capas MoE permiten escalar el número total de parámetros sin activar todos los parámetros para cada token. Las capas de atención siguen siendo importantes para tareas que requieren relaciones detalladas entre tokens. Al combinar estos enfoques, NVIDIA intenta crear un modelo que pueda ofrecer un alto rendimiento sin sacrificar las capacidades necesarias para flujos de trabajo agénticos.
La Longitud de Contexto Alcanza Hasta 1 Millón de Tokens
Otra especificación destacable es la capacidad de contexto del modelo. La documentación de NVIDIA indica soporte para longitudes de contexto de hasta 1 millón de tokens. Una ventana de contexto amplia puede ser útil para agentes de IA que necesitan procesar documentos extensos, repositorios de código fuente, registros o historiales de tareas de larga duración. Un agente que trabaja en un proyecto de software grande, por ejemplo, puede necesitar acceso a muchos archivos e interacciones previas. Un contexto más largo puede reducir la necesidad de resumir o descartar información repetidamente.
Sin embargo, una gran ventana de contexto no significa automáticamente que todas las aplicaciones se beneficien por igual. El rendimiento real depende de la carga de trabajo, la configuración de inferencia y el hardware. Aun así, la capacidad demuestra el enfoque de NVIDIA en sistemas de IA diseñados para operar sobre tareas largas y complejas.
Fuente: Xpost
Nemotron 3.5 Lightning se Suma a una Familia en Crecimiento
El lanzamiento más reciente amplía una familia Nemotron 3 ya más amplia. NVIDIA había presentado anteriormente múltiples modelos diseñados para distintos niveles de cargas de trabajo de IA, incluidos modelos más pequeños para una ejecución eficiente y sistemas más grandes pensados para razonamiento complejo y aplicaciones multiagente. La estrategia de la compañía se basa cada vez más en la especialización.
En lugar de asumir que un solo modelo debe encargarse de todo, NVIDIA está construyendo un conjunto de modelos con fortalezas distintas. Nemotron 3.5 Lightning se ubica en el lado de ejecución de alto volumen de ese espectro. Esto podría volverlo complementario a sistemas de razonamiento más grandes en lugar de un reemplazo directo.
NVIDIA Presenta el Enrutamiento de Modelos con NeMo Switchyard
Junto con el nuevo modelo, NVIDIA está impulsando NeMo Switchyard, una biblioteca diseñada para enrutar tareas a distintos modelos. El concepto es relativamente sencillo. Un sistema puede determinar si una tarea concreta requiere un modelo de razonamiento potente o si un modelo más pequeño y rápido puede completarla. Por ejemplo, una solicitud de planificación compleja podría enviarse a un sistema de razonamiento de frontera, mientras que las tareas repetitivas de ejecución podrían asignarse a Nemotron 3.5 Lightning. NVIDIA afirma que Switchyard permite a los desarrolladores exponer Lightning junto con modelos abiertos y cerrados, y enrutar solicitudes individuales según sus requisitos.
Si este enfoque de enrutamiento de modelos se generaliza, las aplicaciones de IA podrían operar cada vez más como redes de modelos especializados.
La Economía de los Agentes de IA
La economía de los agentes de IA podría convertirse en uno de los temas más importantes de la siguiente etapa de la industria. Un chatbot puede responder a un usuario una sola vez, pero un agente autónomo puede realizar cientos o miles de operaciones para completar un solo objetivo. Si un desarrollador puede usar un modelo más pequeño para la ejecución rutinaria y reservar los modelos de razonamiento más costosos para decisiones difíciles, el costo total de un sistema de IA podría disminuir potencialmente. NVIDIA apuesta a que esta división del trabajo se convertirá en una arquitectura estándar para sistemas agénticos a gran escala.
La Programación es un Caso de Uso Importante
El desarrollo de software es una de las áreas donde los agentes de IA ya están ganando cada vez más actividad. Los agentes de programación pueden inspeccionar repositorios, escribir programas, ejecutar pruebas, identificar errores y realizar correcciones. Estos flujos de trabajo implican interacciones repetidas con herramientas. Un modelo optimizado para una ejecución rápida puede, por tanto, tener un impacto directo en la velocidad de un agente de programación.
La documentación de NVIDIA incluye la programación y las cargas de trabajo agénticas entre las aplicaciones previstas del modelo, incluidos escenarios de desarrollo de software y uso de herramientas. La compañía también afirma que el modelo fue entrenado con datos relacionados con programación, llamadas a herramientas, salidas estructuradas y flujos de trabajo de varios pasos. Ese enfoque distingue al modelo de sistemas diseñados principalmente para aplicaciones conversacionales tradicionales.
Las Aplicaciones Empresariales Podrían Ser Significativas
Las empresas también son un objetivo importante para Nemotron 3.5 Lightning. Las compañías están experimentando con agentes de IA para soporte al cliente, investigación interna, procesamiento de documentos, operaciones de TI, desarrollo de software y automatización de flujos de trabajo. Muchas de estas aplicaciones implican pasos repetitivos.
Un agente de atención al cliente puede recuperar información de una cuenta, validar una solicitud y actualizar registros. Un agente de investigación interna puede recopilar documentos, organizar información y pasar los resultados a otro modelo. Un agente de TI puede ejecutar comandos y verificar si el cambio solicitado fue exitoso. Estas tareas no siempre requieren el razonamiento más profundo posible, pero sí necesitan fiabilidad y velocidad. Ahí es donde NVIDIA cree que puede encajar un modelo como Nemotron 3.5 Lightning.
La Estrategia de IA Más Amplia de NVIDIA
El lanzamiento también demuestra cómo el negocio de IA de NVIDIA se está expandiendo más allá de las GPUs. La compañía sigue siendo uno de los proveedores más importantes del mundo de hardware de computación acelerada, pero su estrategia incluye cada vez más las capas de software y modelo construidas sobre ese hardware. Al publicar modelos abiertos y herramientas de desarrollo, NVIDIA puede animar a los desarrolladores a construir sistemas de IA que, en última instancia, se ejecuten sobre infraestructura de NVIDIA.
Cuanto más ampliamente se adopten sus modelos y software, más sólido se vuelve el ecosistema potencial alrededor de sus plataformas de cómputo. Nemotron forma parte, por tanto, de un esfuerzo más amplio por establecer a NVIDIA como una plataforma de IA de pila completa.
La Competencia en Modelos de IA Abiertos se Intensifica
NVIDIA entra en un mercado de modelos abiertos altamente competitivo. Los desarrolladores tienen acceso a modelos de numerosas empresas tecnológicas y organizaciones de investigación. La competencia ya no gira solo en torno al número de parámetros. Cada vez más, los desarrolladores evalúan los modelos según la velocidad de inferencia, la precisión, la longitud de contexto, la licencia, la personalización, los requisitos de hardware y las capacidades de uso de herramientas.
Un modelo que sea algo menos capaz pero sustancialmente más rápido puede resultar más útil para un agente de IA en producción. Ese es precisamente el mercado al que apunta Nemotron 3.5 Lightning. Su valor dependerá, en última instancia, de si los desarrolladores encuentran atractivas su capacidad de rendimiento y de personalización frente a otros modelos abiertos competidores.
¿Qué Hace Diferente al Modelo Lightning?
La distinción más importante es su carga de trabajo prevista. Nemotron 3.5 Lightning no se posiciona como el único modelo que debería realizar todas las tareas de IA. En cambio, NVIDIA lo ve como un trabajador eficiente. El modelo puede ejecutar operaciones rutinarias a gran volumen mientras los modelos de razonamiento más grandes se enfocan en decisiones estratégicas.
Esto se asemeja a cómo los sistemas de software tradicionales distribuyen las cargas de trabajo entre componentes especializados. La diferencia es que los modelos de IA ahora pueden dividir tareas de forma dinámica según la complejidad. Eso podría hacer que los sistemas de IA sean más eficientes a medida que escalan.
Las Afirmaciones de Rendimiento de NVIDIA Requieren Evaluación Independiente
Las afirmaciones de NVIDIA de hasta cuatro veces más velocidad en la generación de tokens y 30% más rapidez en la finalización son importantes, pero deben verse en contexto. Los resultados de las pruebas de referencia pueden variar según el hardware, la configuración del software, el tamaño del lote, la longitud de la secuencia y los modelos competidores.
NVIDIA informa que Nemotron 3.5 Lightning alcanza la frontera de Pareto de precisión-velocidad en el Artificial Analysis Intelligence Index y reporta un resultado de 86% en PinchBench, con finalización más rápida de 10,000 tareas en comparación con un modelo competidor citado. Los desarrolladores e investigadores independientes terminarán ofreciendo una visión más amplia a medida que el modelo se despliegue en diferentes cargas de trabajo. La publicación de los pesos y la documentación del modelo debería facilitar esas pruebas.
El Ecosistema de Modelos Abiertos Podría Beneficiarse
Los lanzamientos de peso abierto permiten a investigadores y desarrolladores examinar cómo rinden los modelos fuera de las demostraciones controladas de los proveedores. Eso puede derivar en más comparaciones, experimentos de ajuste fino y aplicaciones especializadas. El lanzamiento de NVIDIA incluye pesos del modelo y recursos adicionales destinados a apoyar la personalización. La compañía también ofrece rutas de integración para marcos de inferencia y plataformas de hardware. Eso podría acelerar la adopción entre desarrolladores que quieran experimentar con sistemas agénticos sin construir un modelo desde cero.
Qué Significa Esto para los Inversores de NVIDIA
Para los inversores que siguen la acción NVDA, el lanzamiento de Nemotron 3.5 Lightning difícilmente tendrá la misma importancia financiera inmediata que un gran anuncio de producto de GPU. Sin embargo, ilustra una tendencia estratégica importante. NVIDIA está intentando hacer que su pila tecnológica sea cada vez más central en el desarrollo de IA. Si los desarrolladores usan juntos los modelos, las bibliotecas de optimización y el hardware de NVIDIA, la compañía puede beneficiarse de múltiples capas del ecosistema de IA.
El modelo en sí podría no ser la principal fuente de ingresos. Su valor estratégico podría residir, en cambio, en reforzar la posición de NVIDIA como la plataforma sobre la que se desarrollan y despliegan aplicaciones de IA.
La Próxima Etapa de la IA Podría Tratarse de Eficiencia
La primera fase de la IA generativa estuvo dominada por la escala de los modelos. Las empresas competían por construir sistemas cada vez más grandes y con mayores capacidades de razonamiento. La siguiente fase podría centrarse más en la eficiencia.
Las empresas necesitan IA que pueda operar de forma continua. Necesitan costos predecibles. Necesitan respuestas rápidas. Necesitan sistemas que puedan integrarse con herramientas de software y datos internos. Y necesitan modelos que puedan adaptarse a tareas especializadas.
Nemotron 3.5 Lightning refleja ese cambio. Su arquitectura de 30.000 millones de parámetros, su diseño de 3.000 millones de parámetros activos y su enfoque en la ejecución agéntica de alto volumen buscan hacer que la IA sea práctica a escala.
Coin Bureau y la Conversación Más Amplia sobre IA
El lanzamiento también ha atraído atención en comunidades de redes sociales enfocadas en tecnología y criptomonedas, incluida la conversación asociada con la cuenta de Coin Bureau. Sin embargo, la información técnica principal de este informe proviene del anuncio de NVIDIA y de la documentación del modelo. No pude verificar de forma independiente una publicación específica de Coin Bureau que confirmara las afirmaciones de rendimiento, por lo que dichas afirmaciones se atribuyen a NVIDIA y no se presentan como verificadas independientemente por Coin Bureau.
Esa distinción es importante, ya que las empresas de IA publican cada vez más cifras de rendimiento que pueden variar según las condiciones de prueba.
Qué Sigue para Nemotron
La prueba más importante para Nemotron 3.5 Lightning será su adopción en el mundo real. Los desarrolladores determinarán qué tan fácilmente puede integrarse en marcos de agentes existentes. Las empresas evaluarán su fiabilidad y capacidades de personalización. Los investigadores compararán su rendimiento con otros modelos de peso abierto. Y los proveedores de infraestructura determinarán con qué eficiencia puede operar a distintas escalas.
Si los desarrolladores encuentran que el modelo puede manejar de forma confiable grandes cantidades de tareas rutinarias de agentes manteniendo una precisión sólida, NVIDIA podría contar con un nuevo componente poderoso para la economía emergente de los agentes.
Panorama General
El lanzamiento de Nemotron 3.5 Lightning refleja una transformación más amplia en la inteligencia artificial. La IA está pasando de sistemas que simplemente responden preguntas a sistemas que realizan trabajo.
Esa transición requiere modelos capaces de operar continuamente, interactuar con herramientas de software y gestionar un gran número de acciones individuales. El modelo de razonamiento más potente no siempre será la mejor opción para esas tareas. A veces, la velocidad, la eficiencia y la personalización importan más.
NVIDIA está posicionando Nemotron 3.5 Lightning en torno a esa idea. El modelo combina un gran grupo total de parámetros con activación dispersa, una arquitectura híbrida, soporte de contexto amplio y herramientas de personalización. Su propósito no es necesariamente reemplazar a los modelos de IA más grandes. En cambio, está diseñado para trabajar junto a ellos.
En Resumen
NVIDIA ha ampliado su familia Nemotron 3 con Nemotron 3.5 Lightning, un modelo abierto Mixture-of-Experts de 30.000 millones de parámetros con aproximadamente 3.000 millones de parámetros activos.
El modelo está diseñado específicamente para una ejecución de alto volumen en agentes de IA siempre activos, incluidas llamadas a herramientas, flujos de trabajo de programación, validación de resultados y otras tareas repetitivas.
NVIDIA afirma que Nemotron 3.5 Lightning puede lograr hasta cuatro veces la velocidad de salida de modelos comparables y completar 10,000 tareas agénticas 30% más rápido que un modelo competidor citado, con precisión similar. Esas cifras siguen siendo afirmaciones de rendimiento reportadas por el proveedor y deben evaluarse de forma independiente en diferentes hardware y cargas de trabajo.
El modelo también admite personalización, con NVIDIA publicando pesos y recursos de entrenamiento que los desarrolladores pueden usar para ajuste fino y aprendizaje por refuerzo.
Su arquitectura combina componentes Mamba-2, MoE y de atención, mientras que el modelo admite longitudes de contexto de hasta 1 millón de tokens.
La importancia más amplia del lanzamiento puede estar en su enfoque en la eficiencia. A medida que los agentes de IA se vuelven más autónomos, se espera que realicen miles de operaciones individuales. Ejecutar el modelo de razonamiento más grande en cada paso podría resultar innecesariamente costoso y lento.
La solución propuesta por NVIDIA es dividir el trabajo. Los grandes modelos de razonamiento pueden encargarse de la planificación compleja, mientras que modelos más pequeños y especializados como Nemotron 3.5 Lightning ejecutan rápidamente las tareas rutinarias.
Esa estrategia de enrutamiento de modelos podría convertirse en una parte importante de la arquitectura de IA empresarial.
Para NVIDIA, el lanzamiento también refuerza la posición de la compañía más allá del hardware. Al ofrecer modelos, marcos de desarrollo y herramientas de despliegue junto con sus GPUs, NVIDIA intenta construir un ecosistema que abarque toda la pila de IA.
Que Nemotron 3.5 Lightning se convierta en un modelo importante de la industria dependerá de la adopción por parte de los desarrolladores y de las pruebas independientes.
Pero su lanzamiento subraya una realidad cada vez más importante en el mercado de la IA: la próxima ventaja competitiva puede no provenir solo de construir el modelo más grande.
Puede provenir de construir sistemas de IA que puedan realizar trabajo útil más rápido, de forma más eficiente y a menor costo.