NoticiasMacroStanford y Nvidia lanzan CLM-8B, un modelo de IA hasta 9 veces más rápido que Jev de TypeSafe AI

Stanford y Nvidia lanzan CLM-8B, un modelo de IA hasta 9 veces más rápido que Jev de TypeSafe AI

Autor: CryptoBriefing·

Puntos clave

  • •CLM-8B, lanzado el 23 de septiembre, es el primer Modelo de Lenguaje Contrastivo publicado públicamente y hace que las decisiones en tiempo real de agentes sean aproximadamente nueve veces más rápidas que el modelo propietario Jev de TypeSafe AI.
  • •La arquitectura se basa en un backbone congelado Qwen3-8B con cabezas de proyección entrenables de aproximadamente 20 millones de parámetros cada una, lo que permite que módulos ligeros gestionen la selección de acciones manteniendo bajos los costos de cómputo.
  • •El entrenamiento se realizó en tres fases: 60 millones de pares de preguntas y respuestas para el preentrenamiento, 30 millones de ejemplos negativos difíciles sintéticos para el entrenamiento intermedio y 1 millón de trayectoriasénticas para el postentrenamiento.
  • •El modelo obtuvo 81,6% en DeepSWE y 87,6% en Terminal-Bench 2.1, resultados de estado del arte para su rango de parámetros, e igualó a Jev en modo cero-shot en tareas como el uso de computadoras, juegos y WikiRacing.
  • •CLM-8B se distribuye con pesos abiertos bajo Apache 2.0 y puede autoalojarse en una sola GPU de Nvidia usando vLLM, mientras que su sucesor multimodal CLM-35B está previsto para principios de octubre de 2026.
Stanford y Nvidia lanzan CLM-8B, un modelo de IA hasta 9 veces más rápido que Jev de TypeSafe AI

Stanford y Nvidia han lanzado CLM-8B, un modelo de IA que hace que las decisiones en tiempo real de agentes sean aproximadamente nueve veces más rápidas que las del actual sistema líder. El modelo, disponible desde el 23 de septiembre, es el primer Modelo de Lenguaje Contrastivo publicado públicamente, una categoría que no existía antes del artículo que lo acompaña.

CLM-8B iguala el rendimiento del modelo propietario Jev de TypeSafe AI en múltiples benchmarks, al tiempo que reduce la latencia a una fracción de los niveles anteriores. En el benchmark del juego T-Rex, CLM-8B registró 16,5 milisegundos por decisión, frente a los 149,8 milisegundos de Jev. Para los agentes que encadenan muchas decisiones en una sola ejecución, ese costo por decisión se acumula en cada paso, razón por la cual la cifra de latencia pesa tanto como las puntuaciones de precisión.

Cómo el aprendizaje contrastivo cambia el enfoque

En lugar de generar respuestas desde cero, CLM-8B aplica aprendizaje contrastivo para construir un espacio de embeddings compartido en el que coexisten estados y acciones. Cuando el modelo determina su siguiente movimiento, puntúa las acciones candidatas según qué tan cercanas estén del estado actual dentro de ese espacio.

La arquitectura se construye sobre un backbone congelado Qwen3-8B. La innovación central reside en las cabezas de proyección: pequeños módulos entrenables de aproximadamente 20 millones de parámetros cada uno que aprenden a mapear las entradas al espacio contrastivo. Dado que los pesos del modelo permanecen bloqueados, los costos de cómputo se mantienen manejables mientras las cabezas ligeras realizan el trabajo pesado de la selección de acciones. Cada cabeza representa aproximadamente una cuarta parte del uno por ciento de los ocho mil millones de parámetros del backbone, una asimetría que muestra qué pequeña parte de la red se reentrena realmente.

Liderados por el investigador Jacky Kwok, el equipo describe estos como modelos "System One", término tomado del marco de Daniel Kahneman que distingue el pensamiento rápido e intuitivo del razonamiento lento y deliberado, un encuadre que sitúa la toma de decisiones rápida y automática, en lugar de la deliberación prolongada, en el centro del diseño.

Entrenamiento a gran escala y resultados en benchmarks

El modelo fue entrenado en tres fases distintas. El preentrenamiento utilizó 60 millones de pares de preguntas y respuestas para establecer una comprensión básica. El entrenamiento intermedio introdujo 30 millones de ejemplos negativos difíciles sintéticos. El postentrenamiento refinó el sistema con 1 millón de trayectorias agénticas.

En DeepSWE, un benchmark de programación que evalúa capacidades de ingeniería de software, CLM-8B obtuvo 81,6%. En Terminal-Bench 2.1 alcanzó 87,6%. Ambos resultados representan el estado del arte para modelos de este rango de parámetros, logrados aquí con pesos descargables abiertamente en lugar de un sistema cerrado.

Más allá de la programación, el modelo demostró un rendimiento cero-shot comparable al de Jev en tareas que abarcan el uso de computadoras, entornos de juegos como Super Mario y WikiRacing. La ventaja de velocidad se mantuvo en todos los dominios probados, no solo en el benchmark T-Rex del cual proviene la cifra de 9x.

Pesos abiertos bajo Apache 2.0

CLM-8B se distribuye con pesos abiertos bajo una licencia Apache 2.0, una licencia permisiva que permite el uso comercial y la redistribución con atribución. El código y los archivos del modelo están disponibles en GitHub, y el sistema completo puede autoalojarse en una sola GPU de Nvidia usando vLLM, una huella de despliegue que mantiene los requisitos de hardware al alcance de equipos más pequeños, en contraste con el modelo propietario Jev al que iguala.

Un sucesor multimodal, CLM-35B, ya está en desarrollo, con un lanzamiento previsto para principios de octubre de 2026. Ese lanzamiento será el siguiente punto de control para saber si el enfoque contrastivo se traslada a entornos multimodales.