Stanford e Nvidia rilasciano CLM-8B, un modello AI fino a 9 volte più veloce di Jev di TypeSafe AI
Punti chiave
- •CLM-8B, rilasciato il 23 settembre, è il primo Contrastive Language Model pubblicato pubblicamente e rende le decisioni in tempo reale degli agenti circa nove volte più veloci rispetto al modello proprietarioev di TypeSafe AI.
- •L'architettura si basa su un backbone Qwen3-8B congelato con teste di proiezione addestrabili di circa 20 milioni di parametri ciascuna, consentendo a moduli leggeri di gestire la selezione delle azioni mantenendo bassi i costi computazionali.
- •L'addestramento è avvenuto in tre fasi, con 60 milioni di coppie domanda-risposta per il pre-addestramento, 30 milioni di hard negatives sintetici per il mid-training e 1 milione di traiettorie agentiche per il post-training.
- •Il modello ha ottenuto l'81,6% su DeepSWE e l'87,6% su Terminal-Bench 2.1, risultati all'avanguardia per la sua fascia di parametri, e ha eguagliato Jev in modalità zero-shot su compiti che includono l'uso del computer, il gaming e il WikiRacing.
- •CLM-8B è distribuito con pesi aperti sotto Apache 2.0 e può essere self-hosted su una singola GPU Nvidia con vLLM, mentre il suo successore multimodale CLM-35B è previsto per inizio ottobre 2026.

Stanford e Nvidia hanno rilasciato CLM-8B, un modello AI che rende le decisioni in tempo reale degli agenti circa nove volte più veloci rispetto all'attuale sistema leader. Il modello, reso disponibile il 23 settembre, è il primo Contrastive Language Model pubblicato pubblicamente, una categoria che non esisteva prima dell'articolo scientifico che lo accompagna.
CLM-8B eguaglia le prestazioni del modello proprietario Jev di TypeSafe AI su più benchmark, riducendo al contempo la latenza a una frazione dei livelli precedenti. Nel benchmark del gioco T-Rex, CLM-8B ha registrato 16,5 millisecondi per decisione, contro i 149,8 millisecondi di Jev. Per gli agenti che concatenano molte decisioni in una singola esecuzione, questo costo per decisione si accumula a ogni passo, ed è per questo che il dato sulla latenza pesa quanto i punteggi di accuratezza.
Come l'apprendimento contrastivo cambia l'approccio
Invece di generare risposte da zero, CLM-8B applica l'apprendimento contrastivo per costruire uno spazio di embedding condiviso in cui stati e azioni coesistono. Quando il modello determina la mossa successiva, assegna un punteggio alle azioni candidate in base alla loro vicinanza allo stato corrente all'interno di quello spazio.
L'architettura è costruita sopra un backbone Qwen3-8B congelato. L'innovazione centrale risiede nelle teste di proiezione, piccoli moduli addeabili di circa 20 milioni di parametri ciascuno che imparano a mappare gli ingressi nello spazio contrastivo. Poiché i pesi del modello base restano bloccati, i costi computazionali restano gestibili mentre le teste leggere svolgono il lavoro principale per la selezione delle azioni. Ogni testa rappresenta circa un quarto dell'uno percento degli otto miliardi di parametri del backbone, un'asimmetria che mostra quanto poco della rete sia effettivamente riaddestrato.
Guidati dalla ricercatrice Jacky Kwok, il team definisce questi modelli "System One", un termine mutuato dal quadro di Daniel Kahneman che distingue il pensiero rapido e intuitivo dal ragionamento lento e deliberato — un'inquadratura che pone la decisione rapida e automatica, anziché la deliberazione estesa, al centro del design.
Addestramento su larga scala e risultati nei benchmark
Il modello è stato addestrato in tre fasi distinte. Il pre-addestramento ha utilizzato 60 milioni di coppie domanda-risposta per stabilire la comprensione di base. Il mid-training ha introdotto 30 milioni di hard negatives sintetici. Il post-training ha rifinito il sistema su 1 milione di traiettorie agentiche.
Su DeepSWE, un benchmark di coding che testa le capacità di ingegneria del software, CLM-8B ha ottenuto l'81,6%. Su Terminal-Bench 2.1 ha raggiunto l'87,6%. Entrambi i risultati rappresentano prestazioni all'avanguardia per modelli di questa fascia di parametri, ottenuti qui con pesi scaricabili apertamente anziché con un sistema chiuso.
Oltre al coding, il modello ha dimostrato prestazioni zero-shot comparabili a Jev su compiti che spaziano dall'uso del computer ad ambienti di gioco come Super Mario e al WikiRacing. Il vantaggio di velocità si è mantenuto in ogni dominio testato, non solo nel benchmark T-Rex da cui deriva la cifra di 9x.
Pesi aperti sotto licenza Apache 2.0
CLM-8B è distribuito con pesi aperti sotto licenza Apache 2.0, una licenza permissiva che consente l'uso commerciale e la ridistribuzione con attribuzione. Il codice e i file del modello sono disponibili su GitHub, e l'intero sistema può essere self-hosted su una singola GPU Nvidia utilizzando vLLM — un ingombro di deployment che mantiene i requisiti hardware alla portata di team più piccoli, in contrasto con il modello proprietario Jev che eguaglia.
Un successore multimodale, CLM-35B, è già in sviluppo, con un rilascio previsto per inizio ottobre 2026. Quel rilascio sarà il prossimo punto di controllo per verificare se l'approccio contrastivo si estende agli ambienti multimodali.