NVIDIA расширяет семейство Nemotron 3, выпустив Nemotron 3.5 Lightning — открытую MoE-модель на 30 млрд параметров для рабочих нагрузок ИИ-агентов
Ключевые выводы
- •Nemotron 3.5 Lightning использует архитектуру Mixture-of-Experts: примерно 3 млрд активных параметров из 30 млрд общего числа.
- •NVIDIA заявляет, что модель оптимизирована для постоянно работающих ИИ-агентов с малой задержкой, а не только для сложного рассуждения.
- •Компания сообщает, что модель была на 30% быстрее Qwen3.6 35B при выполнении 10 000 задач при сопоставимой точности и могла обеспечивать до четырех раз более высокую скорость вывода по сравнению с сопоставимыми моделями.
- •NVIDIA выпускает веса модели, обучающие данные и рецепты по лицензии OpenMDW-1.1, а дообучение поддерживается через инструменты NeMo.
- •NVIDIA также представила NeMo Switchyard для маршрутизации задач между более крупными reasoning-моделями и более компактными исполнительными моделями, такими как Nemotron 3.5 Lightning.

NVIDIA расширила семейство моделей искусственного интеллекта Nemotron 3, выпустив Nemotron 3.5 Lightning — открытую Mixture-of-Experts (MoE) модель с 30 млрд параметров, специально созданную для высокочастотных рабочих нагрузок ИИ-агентов.
Новая модель ориентирована на растущий класс ИИ-приложений, которые работают непрерывно и выполняют такие задачи, как вызовы инструментов, обработка данных, операции с программным обеспечением, проверка результатов и обмен сообщениями между различными ИИ-системами. NVIDIA заявляет, что Nemotron 3.5 Lightning может обеспечивать до четырех раз более высокую скорость вывода по сравнению с сопоставимыми моделями в своем классе, а также выполнять большие партии агентных задач до 30% быстрее при сопоставимых уровнях точности.
Это объявление добавляет еще один аспект в расширяющуюся ИИ-стратегию NVIDIA. Компания больше не ограничивается поставкой процессоров для запуска ИИ-систем; она все активнее разрабатывает модели, программное обеспечение и инструменты, призванные помочь бизнесу создавать и разворачивать ИИ-приложения на аппаратной платформе NVIDIA. Это позиционирует NVIDIA не только в конкуренции с производителями чипов вроде AMD и Intel, но и с поставщиками моделей, такими как Meta (Llama), Alibaba (Qwen), Mistral AI и Google (Gemma), на рынке открытых моделей ИИ.
NVIDIA нацеливается на следующий этап развития ИИ-агентов
Последняя модель Nemotron выходит на фоне того, как ИИ-агенты становятся одним из ключевых направлений в технологической отрасли. Традиционные ИИ-ассистенты обычно отвечают на отдельные запросы, тогда как агент может разбивать более крупную цель на несколько действий, использовать внешние инструменты, извлекать информацию, выполнять команды и оценивать результаты перед продолжением работы. Компании, включая OpenAI, Anthropic, Google и Microsoft, уже обозначили агентный ИИ — системы, действующие с большей автономией, — как важный рубеж развития.
Такие системы могут генерировать очень большое число обращений к модели. Например, агент для программирования может многократно просматривать файлы, выполнять команды, анализировать ошибки, изменять код и снова запускать тесты, прежде чем завершит одну задачу. Для каждого отдельного шага может не требоваться самая мощная reasoning-модель — разработчики могут предпочесть более компактную модель, способную быстро и эффективно выполнять повторяющиеся задачи.
Именно на этот рынок нацелена NVIDIA с Nemotron 3.5 Lightning. Компания утверждает, что модель оптимизирована для высокообъемного и малозадержечного выполнения задач, а не для использования исключительно в самых сложных сценариях рассуждения.
Модель на 30 млрд параметров с 3 млрд активных параметров
Ключевой технической особенностью Nemotron 3.5 Lightning является архитектура Mixture-of-Experts. Хотя модель содержит 30 млрд параметров в целом, NVIDIA заявляет, что при одном прямом проходе активно примерно 3 млрд параметров. Это позволяет модели сохранять емкость существенно более крупной системы, уменьшая при этом объем вычислений, необходимый для каждого токена. MoE-архитектуры получили широкое распространение в отрасли: такие модели, как DeepSeek-V3, Mistral's Mixtral и xAI's Grok, используют схожие подходы, чтобы масштабировать число параметров без пропорционального роста вычислений на инференсе.
В традиционной плотной модели практически весь набор параметров участвует в обработке каждого входа. MoE-модель работает иначе: система маршрутизации определяет, какие эксперты должны обработать конкретный токен или часть задачи. Активируются только выбранные эксперты, что позволяет снизить вычислительную нагрузку при сохранении большого общего пула параметров.
NVIDIA утверждает, что такая конструкция делает Nemotron 3.5 Lightning подходящей для высокообъемных нагрузок, где скорость и эффективность имеют критическое значение. При 30 млрд параметров всего и 3 млрд активных параметров она относится к более компактным моделям в более широком семействе Nemotron 3, сохраняя при этом возможности, рассчитанные на сложные агентные сценарии.
Создана для ИИ, работающего постоянно
Понятие "always-on AI agents" — постоянно работающих ИИ-агентов — занимает центральное место в позиционировании новой модели NVIDIA. Компания утверждает, что долгоживущие агенты большую часть времени выполняют сравнительно рутинные операции, а не сложное рассуждение. К таким операциям относятся вызовы инструментов, проверка результатов, форматирование информации, извлечение файлов и передача задач другим моделям.
Запуск большой frontier reasoning-модели для каждой отдельной операции может увеличивать как задержку, так и вычислительные затраты. Подход NVIDIA заключается в разделении нагрузки между разными моделями: более крупная модель может отвечать за стратегическое планирование и сложное рассуждение, а Nemotron 3.5 Lightning — за повторяющиеся шаги исполнения. NVIDIA описывает это как "систему моделей", а не одну модель, отвечающую за все задачи.
Скорость — ключевая характеристика
NVIDIA делает акцент на скорости инференса как на одной из определяющих особенностей Nemotron 3.5 Lightning. Компания сообщает, что на PinchBench модель достигла точности 86%, при этом выполнила 10 000 задач на 30% быстрее, чем Qwen3.6 35B, при сопоставимой точности. NVIDIA также сообщает, что Nemotron 3.5 Lightning достигает фронтира Парето по соотношению точность-скорость в Artificial Analysis Intelligence Index.
Эти показатели являются заявленными результатами NVIDIA, а не независимым подтверждением. Тем не менее акцент на пропускной способности отражает направление развития рынка ИИ. По мере перехода ИИ в производственные среды разработчики все больше обращают внимание на то, насколько быстро и эффективно модели могут выполнять реальные рабочие нагрузки, а не только на их результаты на отдельных бенчмарк-вопросах.
Почему важна эффективность инференса
Обучение крупных ИИ-моделей привлекает большое внимание из-за огромных вычислительных ресурсов, которые оно требует, однако инференс становится не менее важной частью экономики ИИ. По оценкам отраслевых аналитиков, инференс уже составляет значительную и растущую долю общих расходов на ИИ-вычисления, поскольку модели переходят из стадии разработки в живую продуктивную эксплуатацию, обслуживая миллиарды запросов. Каждый раз, когда ИИ-система отвечает на запрос, генерирует код, извлекает информацию или завершает автоматизированную задачу, потребляются вычислительные ресурсы. Для ИИ-агента, работающего непрерывно, эти затраты могут быстро накапливаться.
Модель, которая быстрее выдает ответы и требует меньше активных параметров, потенциально может сократить объем вычислительной инфраструктуры, необходимой для данной нагрузки. Последняя модель NVIDIA решает практическую задачу: как обеспечить непрерывную работу автономных ИИ-систем, не делая каждую отдельную задачу неоправданно дорогой.
Еще одна сильная сторона — настройка под нужды пользователя
NVIDIA также позиционирует Nemotron 3.5 Lightning как настраиваемую модель. Компания сообщает, что разработчики получают веса модели, обучающие данные и рецепты по лицензионной схеме OpenMDW-1.1, которая позволяет адаптировать модель под конкретные приложения. NVIDIA утверждает, что модель можно дообучать с помощью LoRA или полного supervised fine-tuning через инструменты NeMo, а также применять reinforcement learning и оценки на основе среды.
Релиз отражает продолжающийся курс NVIDIA в сторону открытых моделей с доступом к весам. Вместо того чтобы заставлять разработчиков использовать модель исключительно через проприетарный API, открытые модели дают больше контроля над развертыванием. Организации могут запускать модели в собственной инфраструктуре, адаптировать их под конкретные сценарии и интегрировать в существующие ИИ-системы — это особенно важно для компаний, работающих с чувствительной информацией. Такой подход соответствует более широкой отраслевой тенденции: модели Meta Llama, серия Qwen от Alibaba, выпуски Mistral AI и линейка Gemma от Google демонстрируют устойчивый спрос на загружаемые и модифицируемые ИИ-модели.
Развертывание на локальных системах и в дата-центрах
Согласно документации NVIDIA, Nemotron 3.5 Lightning может работать на одной системе DGX Spark или на GPU H100 при определенных конфигурациях. Модель также поддерживается на аппаратной платформе NVIDIA Blackwell и GPU поколения Hopper, а дополнительные варианты развертывания доступны через поддерживаемые фреймворки инференса. Такая гибкость делает модель подходящей как для разработчиков, экспериментирующих с автономными агентами на локальных системах, так и для компаний, работающих в крупных производственных средах.
Гибридная архитектура
Nemotron 3.5 Lightning не опирается исключительно на классическую архитектуру Transformer. NVIDIA описывает ее как гибридную систему, объединяющую Mamba-2, слои Mixture-of-Experts и выбранные слои внимания. Архитектура призвана сбалансировать вычислительную эффективность и способность обрабатывать сложные последовательности. Компоненты в стиле Mamba могут снижать некоторые требования к памяти при обработке последовательностей, а слои MoE позволяют масштабировать общее число параметров без активации всех параметров для каждого токена. Слои внимания по-прежнему важны для задач, где требуются детальные связи между токенами. Благодаря сочетанию этих подходов NVIDIA пытается создать модель, которая может обеспечивать высокую пропускную способность без потери возможностей, необходимых для агентных рабочих процессов.
Длина контекста — до 1 миллиона токенов
Еще одна заметная характеристика — контекстная емкость модели. В документации NVIDIA указана поддержка длины контекста до 1 миллиона токенов. Большое контекстное окно может быть полезно для ИИ-агентов, которым нужно обрабатывать объемные документы, репозитории исходного кода, логи или длительную историю задач. Например, агент, работающий над крупным программным проектом, может нуждаться в доступе к множеству файлов и предыдущих взаимодействий. Более длинный контекст может сократить необходимость многократно суммировать или отбрасывать информацию.
Однако большое окно контекста не означает автоматически, что каждое приложение получит от него одинаковую пользу. Реальная производительность зависит от нагрузки, конфигурации инференса и аппаратного обеспечения. Тем не менее такая возможность показывает, что NVIDIA делает ставку на ИИ-системы, рассчитанные на длительные и сложные задачи.
Источник: Xpost
Nemotron 3.5 Lightning пополняет растущее семейство
Последний релиз расширяет уже более широкое семейство Nemotron 3. Ранее NVIDIA представила несколько моделей, рассчитанных на разные уровни ИИ-нагрузок, включая более компактные модели для эффективного исполнения и более крупные системы для сложного рассуждения и многоагентных сценариев. Стратегия компании все больше строится на специализации: вместо предположения, что одна модель должна выполнять любую работу, NVIDIA создает набор моделей с разными сильными сторонами.
Nemotron 3.5 Lightning позиционируется на стороне высокообъемного исполнения, что делает ее скорее дополнением к более крупным reasoning-системам, чем их прямой заменой.
NVIDIA представляет маршрутизацию моделей с NeMo Switchyard
Наряду с новой моделью NVIDIA продвигает NeMo Switchyard — библиотеку, предназначенную для маршрутизации задач к разным моделям. Система может определять, требует ли конкретная задача мощной reasoning-модели или ее способен выполнить более компактный и быстрый вариант. Например, сложный запрос на планирование может быть отправлен в frontier reasoning-систему, а повторяющиеся задачи исполнения — переданы Nemotron 3.5 Lightning. NVIDIA утверждает, что Switchyard позволяет разработчикам размещать Lightning рядом с открытыми и закрытыми моделями и направлять отдельные запросы в соответствии с их требованиями.
Если такой подход к маршрутизации моделей получит широкое распространение, ИИ-приложения все чаще смогут работать как сети специализированных моделей.
Экономика ИИ-агентов
Экономика ИИ-агентов может стать одним из важнейших вопросов следующего этапа развития отрасли. Чат-бот может ответить пользователю один раз, тогда как автономный агент может выполнить сотни или тысячи операций, чтобы завершить одну цель. Это означает, что стоимость каждой отдельной операции имеет значение. Если разработчик может использовать более компактную модель для рутинного исполнения и оставлять дорогие reasoning-модели для сложных решений, общая стоимость ИИ-системы потенциально может снизиться.
NVIDIA делает ставку на то, что такое разделение труда станет стандартной архитектурой для крупномасштабных агентных систем. Nemotron 3.5 Lightning создана именно для этой роли.
Программирование — важный сценарий использования
Разработка программного обеспечения — одна из областей, где ИИ-агенты уже становятся все более активными. Кодирующие агенты могут анализировать репозитории, писать программы, запускать тесты, выявлять ошибки и вносить исправления. Эти рабочие процессы включают многократные взаимодействия с инструментами. Поэтому модель, оптимизированная для быстрого исполнения, может напрямую влиять на скорость работы кодирующего агента.
В документации NVIDIA среди предполагаемых сценариев использования модели указаны программирование и агентные нагрузки, включая разработку ПО и сценарии работы с инструментами. Компания также сообщает, что модель обучалась на данных, связанных с кодированием, вызовами инструментов, структурированными выводами и многошаговыми рабочими процессами.
Корпоративные сценарии могут оказаться значимыми
Бизнес также, вероятно, станет одной из главных целевых аудиторий Nemotron 3.5 Lightning. Компании экспериментируют с ИИ-агентами для поддержки клиентов, внутреннего поиска и анализа, обработки документов, ИТ-операций, разработки ПО и автоматизации рабочих процессов. Многие из этих сценариев состоят из повторяющихся шагов. Например, агент службы поддержки может извлечь данные учетной записи, проверить запрос и обновить записи. Агент для внутренних исследований может собрать документы, упорядочить информацию и передать результаты другой модели. ИТ-агент может выполнить команды и проверить, был ли запрошенный change успешным.
Для таких задач не всегда требуется максимально глубокое рассуждение, но им необходимы надежность и скорость. Именно здесь, по мнению NVIDIA, может быть полезна модель вроде Nemotron 3.5 Lightning.
Более широкая ИИ-стратегия NVIDIA
Запуск также демонстрирует, как ИИ-бизнес NVIDIA выходит за пределы GPU. Компания по-прежнему остается одним из важнейших мировых поставщиков ускоренного вычислительного оборудования, однако ее стратегия все чаще включает программный и модельный уровни, построенные поверх этого оборудования. Выпуская открытые модели и инструменты разработки, NVIDIA может стимулировать создание ИИ-систем, которые в конечном итоге будут работать на инфраструктуре NVIDIA. Nemotron является частью более широкой инициативы по превращению NVIDIA в полноценную ИИ-платформу, охватывающую весь стек.
Конкуренция на рынке открытых ИИ-моделей усиливается
NVIDIA выходит на высококонкурентный рынок открытых моделей. У разработчиков есть доступ к моделям многочисленных технологических компаний и исследовательских организаций. Конкуренция уже не сводится только к числу параметров. Разработчики все чаще оценивают модели по скорости инференса, точности, длине контекста, лицензированию, возможностям настройки, аппаратным требованиям и способности работать с инструментами.
Модель, которая немного уступает по возможностям, но заметно быстрее, может быть полезнее для производственного ИИ-агента. Именно на этот рынок и нацелена Nemotron 3.5 Lightning. Ее ценность в конечном итоге будет зависеть от того, сочтут ли разработчики ее производительность и возможности настройки привлекательными по сравнению с конкурирующими открытыми моделями.
Чем отличается модель Lightning?
Самое важное отличие — предполагаемая нагрузка. Nemotron 3.5 Lightning не позиционируется как единственная модель, которая должна выполнять все ИИ-задачи. Вместо этого NVIDIA рассматривает ее как эффективную рабочую модель. Она может выполнять рутинные операции в больших объемах, тогда как более крупные reasoning-модели будут сосредоточены на стратегических решениях.
Это похоже на то, как традиционные программные системы распределяют нагрузку между специализированными компонентами. Разница в том, что теперь ИИ-модели могут динамически делить задачи в зависимости от сложности. Это может сделать ИИ-системы более эффективными по мере масштабирования.
Заявления NVIDIA о производительности требуют независимой проверки
Заявления NVIDIA о скорости генерации токенов до четырех раз выше и о выполнении на 30% быстрее важны, но их следует рассматривать в контексте. Результаты бенчмарков могут меняться в зависимости от аппаратного обеспечения, конфигурации ПО, размера батча, длины последовательности и конкурирующих моделей.
NVIDIA сообщает, что Nemotron 3.5 Lightning достигает фронтира Парето по точности и скорости в Artificial Analysis Intelligence Index и показывает результат 86% в PinchBench, выполняя 10 000 задач быстрее, чем указанный конкурент. В конечном счете независимые разработчики и исследователи дадут более полную картину по мере развертывания модели в различных рабочих нагрузках.
Публикация весов модели и документации должна облегчить такое тестирование.
Открытая экосистема моделей может выиграть
Выпуск открытых весов позволяет исследователям и разработчикам изучать работу моделей вне контролируемых демонстраций вендора. Это может привести к большему числу сравнений, экспериментов по дообучению и специализированных сценариев использования. NVIDIA включает в релиз веса модели и дополнительные ресурсы, предназначенные для поддержки кастомизации. Компания также предоставляет пути интеграции для фреймворков инференса и аппаратных платформ.
Это может ускорить принятие среди разработчиков, которые хотят экспериментировать с агентными системами, не создавая модель с нуля.
Что это значит для инвесторов NVIDIA
Для инвесторов, следящих за акциями NVDA, запуск Nemotron 3.5 Lightning вряд ли будет иметь такое же немедленное финансовое значение, как крупный анонс GPU-продукта. Однако он отражает важную стратегическую тенденцию. NVIDIA стремится сделать свой технологический стек все более центральным элементом разработки ИИ.
Если разработчики будут использовать модели NVIDIA, библиотеки оптимизации и аппаратное обеспечение вместе, компания сможет получать выгоду из нескольких уровней ИИ-экосистемы. Сама модель может не стать основным источником выручки; ее стратегическая ценность может заключаться в укреплении позиции NVIDIA как платформы, на которой разрабатываются и разворачиваются ИИ-приложения.
Следующий этап ИИ может быть связан с эффективностью
Первая фаза генеративного ИИ была сосредоточена на масштабе моделей. Компании соревновались в создании все более крупных систем с более мощными способностями к рассуждению. Следующая фаза может быть больше сфокусирована на эффективности.
Бизнесу нужен ИИ, который может работать непрерывно. Нужны предсказуемые затраты. Нужны быстрые ответы. Нужны системы, которые могут интегрироваться с программными инструментами и внутренними данными. И нужны модели, которые можно адаптировать под специализированные задачи.
Nemotron 3.5 Lightning отражает этот сдвиг. Ее архитектура с 30 млрд параметров, дизайн с 3 млрд активных параметров и акцент на высокообъемном агентном исполнении нацелены на то, чтобы сделать ИИ практичным в масштабе.
Coin Bureau и более широкий разговор об ИИ
Релиз также привлек внимание в технологических и криптовалютных сообществах в социальных сетях, включая обсуждение, связанное с аккаунтом Coin Bureau. Однако основная техническая информация в этом материале получена из собственного объявления NVIDIA и документации модели. Я не смог независимо подтвердить конкретный пост Coin Bureau, подтверждающий заявления о производительности, поэтому эти заявления приписываются NVIDIA, а не представлены как независимо верифицированные Coin Bureau.
Это различие важно, поскольку ИИ-компании все чаще публикуют показатели производительности, которые могут меняться в зависимости от условий тестирования.
Что дальше для Nemotron
Самым важным испытанием для Nemotron 3.5 Lightning станет реальное внедрение. Разработчики определят, насколько легко модель можно интегрировать в существующие агентные фреймворки. Бизнес оценит ее надежность и возможности настройки. Исследователи сравнят ее производительность с другими моделями открытых весов. А поставщики инфраструктуры определят, насколько эффективно она может работать в разных масштабах.
Если разработчики увидят, что модель надежно справляется с большим числом рутинных агентных задач при сохранении высокой точности, у NVIDIA может появиться мощный новый компонент для формирующейся агентной экономики.
Общая картина
Релиз Nemotron 3.5 Lightning отражает более широкую трансформацию в сфере искусственного интеллекта. ИИ движется от систем, которые просто отвечают на вопросы, к системам, которые выполняют работу.
Такой переход требует моделей, способных работать непрерывно, взаимодействовать с программными инструментами и выполнять большое число отдельных действий. Самая мощная reasoning-модель не всегда будет лучшим выбором для таких задач. Иногда важнее скорость, эффективность и возможность настройки.
NVIDIA позиционирует Nemotron 3.5 Lightning именно вокруг этой идеи. Модель сочетает большой общий пул параметров со sparse activation, гибридную архитектуру, поддержку длинного контекста и инструменты для кастомизации. Ее цель не обязательно заменить крупнейшие ИИ-модели. Скорее, она должна работать вместе с ними.
Итог
NVIDIA расширила семейство Nemotron 3, представив Nemotron 3.5 Lightning — открытую MoE-модель на 30 млрд параметров с примерно 3 млрд активных параметров. Модель специально создана для высокообъемного исполнения в постоянно работающих ИИ-агентах, включая вызовы инструментов, сценарии программирования, проверку результатов и другие повторяющиеся задачи.
NVIDIA утверждает, что Nemotron 3.5 Lightning может достигать скорости вывода до четырех раз выше по сравнению с сопоставимыми моделями и выполнять 10 000 агентных задач на 30% быстрее, чем указанный конкурент, при сопоставимой точности. Эти показатели остаются заявленными вендором и должны оцениваться независимо на разном оборудовании и разных рабочих нагрузках.
Модель также поддерживает настройку: NVIDIA публикует веса и обучающие ресурсы, которые разработчики могут использовать для дообучения и reinforcement learning. Ее архитектура объединяет Mamba-2, MoE и компоненты внимания, а сама модель поддерживает длину контекста до 1 миллиона токенов.
Более широкое значение запуска может заключаться в акценте на эффективности. По мере того как ИИ-агенты становятся более автономными и должны выполнять тысячи отдельных операций, предлагаемое NVIDIA решение состоит в разделении труда. Крупные reasoning-модели занимаются сложным планированием, а более компактные специализированные модели, такие как Nemotron 3.5 Lightning, быстро выполняют рутинные задачи. Такая стратегия маршрутизации моделей, поддерживаемая NeMo Switchyard, может стать важной частью корпоративной ИИ-архитектуры.