Stanford и Nvidia выпустили CLM-8B — ИИ-модель, работающую до 9 раз быстрее Jev от TypeSafe AI
Ключевые выводы
- •CLM-8B, выпущенная 23 сентября, — первая публично доступная контрастивная языковая модель, принимающая решения ИИ-агентов в реальном времени примерно в девять раз быстрее проприетарной модели Jev от TypeSafe AI.
- •Архитектура построена на замороженной базе Qwen3-8B с обучаемыми проекционными головками примерно по 20 миллионов параметров каждая, что позволяет легковесным модулям отвечать за выбор действий при низких вычислительных затратах.
- •Обучение прошло три этапа: 60 миллионов пар «вопрос — ответ» на предобучении, 30 миллионов синтетических сложных негативных примеров на среднем этапе и 1 миллион агентных траекторий на постобучении.
- •Модель набрала 81,6% на DeepSWE и 87,6% на Terminal-Bench 2.1 — лучшие в своем диапазоне параметров результаты — и сопоставима с Jev в zero-shot-режиме на задачах работы с компьютером, играх и WikiRacing.
- •CLM-8B выпущена с открытыми весами под Apache 2.0 и может быть самостоятельно размещена на одной GPU Nvidia с помощью vLLM, а мультимодальная преемница CLM-35B ожидается в начале октября 2026 года.

Stanford и Nvidia выпустили CLM-8B — ИИ-модель, которая принимает решения ИИ-агентов в реальном времени примерно в девять раз быстрее, чем текущая ведущая система. Модель, ставшая доступной 23 сентября, — это первая публично выпущенная контрастивная языковая модель, категория, которой не существовало до выхода сопутствующей научной работы.
CLM-8B сопоставима по производительности с проприетарной моделью Jev от TypeSafe AI на нескольких бенчмарках, при этом сокращая задержку до доли прежних значений. На игровом бенчмарке T-Rex CLM-8B показала 16,5 миллисекунды на решение против 149,8 миллисекунд у Jev. Для агентов, выстраивающих множество решений в одну цепочку, эти накладные расходы на каждое решение накапливаются на каждом шаге — именно поэтому показатель задержки так же важен, как и оценки точности.
Как контрастивное обучение меняет подход
Вместо генерации ответов с нуля CLM-8B применяет контрастивное обучение для построения общего пространства вложений, в котором состояния и действия сосуществуют. Когда модели нужно определить следующий шаг, она оценивает варианты действий по тому, насколько близко они соответствуют текущему состоянию в этом пространстве.
Архитектура построена поверх замороженной базы Qwen3-8B. Ключевая инновация — в проекционных головках: небольших обучаемых модулях примерно по 20 миллионов параметров каждый, которые учатся отображать входные данные в контрастивное пространство. Поскольку веса базовой модели остаются заблокированными, вычислительные затраты остаются умеренными, а легковесные головки выполняют основную работу по выбору действий. Каждая головка составляет примерно четверть процента от восьми миллиардов параметров базы — асимметрия, показывающая, какая малая часть сети фактически переобучается.
Под руководством исследователя Джеки Квока команда называет такие модели «System One», заимствуя термин из концепции Даниэля Канемана, различающей быстрое, интуитивное мышление и медленное, обдуманное рассуждение — рамка, ставящая во главу угла быстрое автоматическое принятие решений, а не длительное обдумывание.
Масштабное обучение и результаты бенчмарков
Обучение модели прошло три отдельных этапа. Предварительное обучение использовало 60 миллионов пар «вопрос — ответ» для формирования базового понимания. Средний этап ввел 30 миллионов синтетических сложных негативных примеров. Постобучение доработало систему на 1 миллионе агентных траекторий.
На DeepSWE — бенчмарке программирования, проверяющем возможности инженерии ПО, — CLM-8B набрала 81,6%. На Terminal-Bench 2.1 она достигла 87,6%. Оба результата представляют собой лучший в отрасли показатель для моделей этого диапазона параметров, достигнутый при этом открыто загружаемыми весами, а не закрытой системой.
Помимо программирования, модель продемонстрировала zero-shot-производительность, сопоставимую с Jev, на задачах, охватывающих работу с компьютером, игровые среды вроде Super Mario и WikiRacing. Преимущество в скорости сохранялось во всех протестированных доменах, а не только на бенчмарке T-Rex, из которого взята цифра 9x.
Открытые веса под Apache 2.0
CLM-8B поставляется с открытыми весами по лицензии Apache 2.0 — разрешительной лицензии, допускающей коммерческое использование и распространение с указанием авторства. Код и файлы модели доступны на GitHub, а всю систему можно самостоятельно разместить на одной GPU Nvidia с помощью vLLM — формат развертывания, делающий аппаратные требования доступными для небольших команд, в отличие от проприетарной модели Jev, которой она не уступает.
Мультимодальная преемница CLM-35B уже находится в разработке с целевым релизом в начале октября 2026 года. Этот релиз станет следующей проверкой того, переносится ли контрастивный подход на мультимодальные сценарии.