Stanford i Nvidia wydają CLM-8B, model AI nawet 9 razy szybszy niż Jev od TypeSafe AI
Najważniejsze informacje
- •CLM-8B, wydany 23 września, to pierwszy publicznie dostępny kontrastywny model językowy i podejmuje decyzje agentów w czasie rzeczywistym około dziewięć razy szybciej niż własnościowy model Jev firmy TypeSafe AI.
- •Architektura opiera się na zamrożonym szkielecie Qwen3-8B z trenowalnymi głowicami projekcyjnymi po około 20 milionów parametrów każda, dzięki czemu lekkie moduły obsługują wybór akcji przy niskich kosztach obliczeniowych.
- •Trening przebiegał w trzech fazach: pre-training z 60 milionami par pytanie–odpowiedź, mid-training z 30 milionami syntetycznych trudnych negatywów oraz post-training na 1 milionie trajektorii agentowych.
- •Model uzyskał 81,6% w DeepSWE i 87,6% w Terminal-Bench 2.1 — wyniki na poziomie najlepszym w swojej klasie parametrów — i dorównał Jev w trybie zero-shot w zadaniach obejmujących obsługę komputera, gry i WikiRacing.
- •CLM-8B jest dostarczany z otwartymi wagami na licencji Apache 2.0 i może być hostowany samodzielnie na pojedynczym GPU Nvidii przy użyciu vLLM, a jego multimodalny następca CLM-35B ma się ukazać na początku października 2026 roku.

Stanford i Nvidia udostępniły CLM-8B, model AI, który podejmuje decyzje agentów w czasie rzeczywistym około dziewięć razy szybciej niż obecnie wiodący system. Model, udostępniony 23 września, jest pierwszym publicznie wydanym kontrastywnym modelem językowym — kategorią, która nie istniała przed publikacją towarzyszącego mu artykułu naukowego.
CLM-8B dorównuje wydajności własnościowego modelu Jev firmy TypeSafe AI w wielu benchmarkach, jednocześnie redukując opóźnienie do ułamka poprzednich wartości. W benchmarku gry T-Rex CLM-8B zarejestrował 16,5 milisekundy na decyzję, wobec 149,8 milisekundy dla Jev. Dla agentów, którzy łączą wiele decyzji w jednym przebiegu, ten narzut na pojedynczą decyzję kumuluje się przy każdym kroku — dlatego wartość opóźnienia ma tu takie samo znaczenie jak wyniki dokładności.
Jak uczenie kontrastywne zmienia podejście
Zamiast generować odpowiedzi od zera, CLM-8B stosuje uczenie kontrastywne, aby zbudować wspólną przestrzeń osadzeń, w której współistnieją stany i akcje. Gdy model określa swój kolejny ruch, ocenia kandydującecje według tego, jak blisko pasują do bieżącego stanu w tej przestrzeni.
Architektura została zbudowana na zamrożonym szkielecie Qwen3-8B. Kluczowa innowacja znajduje się w głowicach projekcyjnych — małych, trenowalnych modułach liczących około 20 milionów parametrów każdy, które uczą się mapować wejścia do przestrzeni kontrastywnej. Ponieważ wagi modelu bazowego pozostają zablokowane, koszty obliczeniowe pozostają pod kontrolą, a lekkie głowice wykonują główną pracę przy wyborze akcji. Każda głowica stanowi około ćwierć procenta ośmiu miliardów parametrów szkieletu — asymetria pokazująca, jak niewielka część sieci jest faktycznie dotrenowywana.
Zespół kierowany przez badacza Jacky'ego Kwoka nazywa je modelami „System One”, zapożyczając termin z ram koncepcyjnych Daniela Kahnemana, odróżniających szybkie, intuicyjne myślenie od powolnego, przemyślanego rozumowania — ujęcie, które stawia w centrum projektu szybkie, automatyczne podejmowanie decyzji, a nie przedłużoną deliberację.
Trening na dużą skalę i wyniki benchmarków
Model był trenowany w trzech wyraźnych fazach. Pre-training wykorzystywał 60 milionów par pytanie–odpowiedź w celu zbudowania bazowego rozumienia. Mid-training wprowadził 30 milionów syntetycznych trudnych negatywów. Post-training dopracował system na 1 milionie trajektorii agentowych.
W DeepSWE, benchmarku programistycznym testującym umiejętności inżynierii oprogramowania, CLM-8B uzyskał 81,6%. W Terminal-Bench 2.1 osiągnął 87,6%. Oba wyniki reprezentują najlepszą dostępną wydajność dla modeli w tym zakresie parametrów, osiągniętą tutaj dzięki publicznie dostępnym wagom, a nie systemowi zamkniętemu.
Poza programowaniem model wykazał wydajność zero-shot porównywalną z Jev w zadaniach obejmujących obsługę komputera, środowiska gier takie jak Super Mario oraz WikiRacing. Przewaga prędkości utrzymywała się w każdej testowanej dziedzinie, nie tylko w benchmarku T-Rex, z którego pochodzi wartość 9x.
Otwarte wagi na licencji Apache 2.0
CLM-8B jest dostarczany z otwartymi wagami na licencji Apache 2.0 — licencji permisywnej, która pozwala na użytkowanie komercyjne i redystrybucję z podaniem autorstwa. Kod i pliki modelu są dostępne na GitHubie, a cały system można hostować samodzielnie na pojedynczym GPU Nvidii przy użyciu vLLM — wdrożenie, które utrzymuje wymagania sprzętowe w zasięgu mniejszych zespołów, w przeciwieństwie do własnościowego modelu Jev, któremu dorównuje.
Multimodalny następca, CLM-35B, jest już w rozwoju, z planowaną premierą natek października 2026 roku. Ta premiera będzie kolejnym punktem kontrolnym sprawdzającym, czy podejście kontrastywne przenosi się do ustawień multimodalnych.