НовостиАкцииNVIDIA запускает Nemotron 3.5 Lightning и NeMo Switchyard для более умного и эффективного агентного ИИ

NVIDIA запускает Nemotron 3.5 Lightning и NeMo Switchyard для более умного и эффективного агентного ИИ

Автор: NVIDIA Blog·

Ключевые выводы

  • Nemotron 3.5 Lightning — это полностью настраиваемая открытая модель mixture-of-experts с 30 миллиардами параметров, предназначенная для высоконагруженных специализированных задач в агентных ИИ-процессах.
  • NVIDIA сообщает, что Nemotron 3.5 Lightning обеспечивает скорость вывода до 4 раз выше и завершение агентных задач на 30% быстрее по сравнению с другими моделями в своём классе.
  • NeMo Switchyard — это библиотека маршрутизации с открытым исходным кодом, которая автоматически направляет каждый запрос к наиболее способной и экономичной модели, снижая стоимость завершения задачи примерно до одной трети от использования одной frontier-модели.
  • Модель поддерживает гибкое развёртывание на локальных системах, периферийных устройствах, рабочих станциях, в дата-центрах и облачных средах, позволяя организациям балансировать задержку, конфиденциальность и повторное использование инфраструктуры.
  • NVIDIA выпускает сопутствующий набор данных агентного обучения с подкреплением Nemotron-RL-Agentic-Terminal-Pivot для последующего дообучения навыков coding agent.
NVIDIA запускает Nemotron 3.5 Lightning и NeMo Switchyard для более умного и эффективного агентного ИИ

По мере того как искусственный интеллект переходит от чат-ботов к автономным агентам, модели с открытым исходным кодом всё чаще отвечают требованиям предприятий к полному контролю над тем, где работает ИИ, как он развёртывается и как развивается.

Сегодня NVIDIA расширяет семейство моделей Nemotron 3 выпуском Nemotron 3.5 Lightning — модели mixture-of-experts с 30 миллиардами параметров, которая является самой эффективной в своём классе для длительных агентных ИИ-нагрузок. Этот релиз следует за Nemotron 3 Nano и отражает стремление NVIDIA постоянно улучшать открытые модели, повышая точность и скорость.

Также NVIDIA выпускает NeMo Switchyard — библиотеку с открытым исходным кодом для интеллектуальной маршрутизации внутри популярных инструментов для агентов. Компании могут использовать её для создания маршрутизатора, настроенного под их конкретные потребности. После развёртывания NeMo Switchyard способен интеллектуально направлять каждый запрос к наиболее подходящей и способной модели без необходимости переписывать приложения.

Вместе Nemotron 3.5 Lightning и NeMo Switchyard обеспечивают больший контроль над тем, как ИИ развёртывается, где он работает и насколько эффективно функционирует — на ПК, рабочих станциях, в дата-центрах и облаке.

Круглосуточным агентам нужна система моделей

Современные агентные системы — всегда активные агенты — всё чаще работают как системы моделей, или ансамбли моделей, в которых разные модели специализируются на разных задачах.

Открытые модели NVIDIA Nemotron созданы именно для такой архитектуры. Frontier-модель для рассуждений, такая как Nemotron 3 Ultra или GPT-5.6, может планировать и координировать рабочий процесс, тогда как более компактные специализированные модели, такие как Nemotron 3.5 Lightning, могут выполнять целевые задачи — например, проверку кода, использование инструментов, мониторинг предупреждений безопасности и ответы на вопросы по выставлению счетов.

Обработка высоконагруженных специализированных задач с помощью Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning — это полностью настраиваемая открытая модель, созданная для высоконагруженных задач, лежащих в основе круглосуточных агентов. Модель разработана при участии Nemotron Coalition, члены которой предоставили методики оценки, программное обеспечение для инференса и наборы данных, помогая развитию модели.

Модель обеспечивает скорость вывода до 4 раз выше, что приводит к завершению агентных задач на 30% быстрее по сравнению с другими моделями в своём классе. Поскольку модель открытая и настраиваемая, Nemotron 3.5 Lightning можно легко дообучать с помощью NVIDIA NeMo на собственных отраслевых данных, инструментах и рабочих процессах организации, чтобы повысить точность для специализированных задач.

Лидеры ИИ в разных отраслях уже настраивают Nemotron 3.5 Lightning под свои рабочие нагрузки, включая CrowdStrike для кибербезопасности, Harvey совместно с Trajectory для юридических услуг и CodeRabbit с Baseten для проверки кода, что помогает повышать точность специализированных агентных задач. Кроме того, Lila Sciences помогает улучшать способности рассуждения для агентных задач в областях физических и естественных наук, а Fastino Labs адаптировала модель и отмечает ведущую точность для рабочих нагрузок в разработке ПО, финансах и здравоохранении.

Nemotron 3.5 Lightning также даёт организациям контроль над конфиденциальностью и развёртыванием. Она может работать на локальных ИИ-системах — включая NVIDIA RTX PCs, NVIDIA DGX Spark, NVIDIA DGX Station и NVIDIA Jetson — помогая максимально использовать уже имеющуюся инфраструктуру, либо масштабироваться на периферийных ИИ-устройствах, рабочих станциях NVIDIA RTX PRO, в дата-центрах и облачных средах для корпоративных сценариев. Кроме того, Nemotron 3.5 Lightning может работать локально или в пределах собственной инфраструктуры для высоконагруженных специализированных задач, где требуется быстрый отклик.

Как и в случае с каждым запуском Nemotron, NVIDIA публикует как можно больше обучающих данных и методик в пределах, разрешённых лицензией, что обеспечивает прослеживаемость, аудит и обучение других моделей. Вместе с Lightning NVIDIA также выпускает Nemotron-RL-Agentic-Terminal-Pivot — набор данных для агентного обучения с подкреплением, используемый для последующего дообучения модели навыкам coding agent.

Более эффективные ИИ-приложения с маршрутизацией моделей

Одни модели лучше подходят для программирования, другие — для рассуждений, лёгких задач или локального запуска ради большей конфиденциальности и эффективности. Если клиенты полагаются на одну модель по умолчанию, они могут либо переплачивать, либо терять в качестве; если же маршрутизацией управлять вручную, это превращается в интеграционную работу, способную замедлить развёртывание.

NVIDIA NeMo Switchyard — это библиотека маршрутизации моделей с открытым исходным кодом для ИИ-агентов. Технология автоматически направляет запросы к наиболее способной и эффективной модели на каждом этапе агентного рабочего процесса, исходя из конкретных потребностей. Разработчики агентных приложений могут настраивать или изменять маршрутизатор с помощью разных алгоритмов маршрутизации, чтобы он соответствовал их приоритетам, таким как качество, задержка и стоимость. В системе моделей предприятия могут создавать мощных ИИ-агентов с улучшенной tokenomics.

Внутренние тесты показывают, что NeMo Switchyard сохраняет точность уровня frontier, при этом снижая стоимость завершения задачи почти до одной трети затрат при использовании только Opus 4.8.

NVIDIA работает с партнёрами по всей ИИ-экосистеме, чтобы внедрить интеллектуальную маршрутизацию моделей в уже используемые разработчиками инструменты и платформы.

Boomi : Оценивала Switchyard по пяти возможностям маршрутизации, достигнув 100% точности маршрутизации по доменам, направляя 59% трафика на fine-tuned модель, работающую в 5 раз быстрее, и сократив задержку на поздних шагах на 21%.

Cadence : Повысила эффективность на 9.9% при использовании ChipStack AI Super Agent для сценария формальной верификации.

Classmethod : Внутренне использует opencode и Fireworks workloads с NeMo Switchyard, при этом первоначальные тесты показали снижение затрат на 27% при сохранении качества.

Cognition : Интегрировала staged router NeMo Switchyard в Devin Desktop для внутреннего использования NVIDIA, достигнув производительности почти на уровне frontier на FrontierCode Main и снизив среднюю стоимость на 28% по сравнению с маршрутизацией всех запросов к одной базовой frontier-модели.

Kong : Обеспечивает маршрутизацию с NeMo Switchyard нативно через Kong AI Gateway.

LangChain : С NeMo Switchyard добилась снижения затрат на 74% в 145 многотуровых задачах Deep Agents, направляя только 7% вызовов на frontier-модель, при компромиссе по точности на 6%.

LiteLLM : Добавляет NeMo Switchyard как плагин в свой proxy layer, чтобы разработчики могли получить эти преимущества без изменения существующего стека.

Nous Research : Интегрировала NeMo Switchyard в Hermes, чтобы предоставить разработчикам легко настраиваемую систему маршрутизации, повышающую эффективность агентов.

Ramp : Использовала NeMo Switchyard, чтобы сопоставить производительность frontier-модели, сократив затраты на 58% и время выполнения на 33% в Ramp SWE-Bench.

Siemens : Проводит бенчмаркинг, чтобы повысить эффективность своего Fuse EDA AI Agent.

Nemotron 3.5 Lightning доступна на Hugging Face, ModelScope, OpenRouter и build.nvidia.com как микросервис NVIDIA NIM, а также через широкую экосистему NVIDIA Cloud Partners, платформ post-training, inference-платформ и облачных провайдеров. NeMo Switchyard доступна на GitHub и вскоре появится на платформах партнёров.