Nvidia SONIC обучает гуманоидов движению
Ключевые выводы
- •Nvidia SONIC — это открытая базовая модель, которая обеспечивает управление всем телом для гуманоидных роботов; в июле был выпущен checkpoint для телеуправления и применений на основе vision-language-action.
- •Модель обучена на более чем 100 миллионах кадров motion-capture, что эквивалентно примерно 700 часам человеческих движений, и существует в версиях от 1,2 миллиона до 42 миллионов параметров.
- •В тестах роботы с SONIC выполняли задачи по помещению дрели в коробку, выбрасыванию банки из-под газировки, обращению с повседневными объектами, а также кунг-фу и ползанию, имитируя человека в реальном времени.
- •Исследование SONIC опубликовано в Science Robotics, а модель вписывается в экосистемы Nvidia Isaac и Cosmos, преобразуя высокоуровневые намерения платформы Isaac GR00T в скоординированное физическое движение.
- •SONIC остается исследовательской системой: Yuke Zhu из Nvidia указал на взаимодействия с большим количеством контактов, разрыв между симуляцией и реальностью, а также необходимость проверки долговременной устойчивости, надежности и безопасности как на ключевые нерешенные вопросы.

Humanoidные роботы теперь можно обучать ходьбе, бегу, ползанию, танцам и манипуляциям с объектами с помощью одной базовой модели Nvidia.
SONIC от Nvidia — сокращение от «supersizing motion tracking for natural humanoid control» — предназначена для обеспечения гуманоидных роботов управлением всем телом, позволяя им координировать суставы, сохранять равновесие и адаптировать движения в реальном времени.
Легкая open-source базовая модель теперь публично доступна, а в июле Nvidia выпустила checkpoint для применений, включая телеуправление и управление на основе vision-language-action (VLA). Исследование, лежащее в основе SONIC, также было опубликовано в этом месяце в Science Robotics в рамках стремления Nvidia сделать модель доступной большему числу инженеров.
Иной подход к управлению роботами
Пока языковые и визуальные модели быстро расширялись, включая миллиарды параметров, обученных на бесчисленных наборах данных, модели, используемые для управления движениями гуманоидов, оставались относительно небольшими — всего несколько GPU, настроенных на ограниченный набор поведений. Добавление нового навыка или движения в арсенал робота обычно требовало создания совершенно нового контроллера, что частично объясняет, почему гуманоидные системы медленнее обобщают задачи, чем программные AI-модели.
SONIC призвана изменить это. Модель использует более 100 миллионов кадров motion-capture — это около 700 часов человеческих движений — чтобы создать единую модель обучения робота.
«Управление всем телом требует, чтобы каждый сустав координировался, при этом сохранялось равновесие, учитывались контакты и в реальном времени адаптировались меняющиеся цели движения», — сказал Yuke Zhu, директор и выдающийся исследователь Nvidia, в комментарии AI Business.
Как это работает
SONIC была продемонстрирована по трем параметрам: размер модели, обучающие данные и вычислительные ресурсы, при этом обучающие модели варьировались от 1,2 миллиона до 42 миллионов параметров. В результате получился контроллер, который может отслеживать широкий спектр движений и одновременно адаптироваться к тем, с которыми он не сталкивался во время обучения.
Для Zhu это означает изменение подхода к программированию гуманоидных роботов.
«Вместо ручного проектирования контроллеров для отдельных навыков SONIC изучает общую основу движения посредством масштабного отслеживания движений», — сказал он. «Одна и та же policy может управляться моделями VR, видео или VLA и обобщается на поведение за пределами того, что было видно во время обучения».
Такая гибкость может становиться все более важной по мере того, как гуманоидные роботы переходят от контролируемых демонстраций к реальным, непредсказуемым условиям, где координация, баланс и восстановление не менее важны, чем сама целевая задача.
В тестах команда показала, как SONIC выполняет ряд задач, включая подъем и помещение дрели в коробку, выбрасывание банки из-под газировки в мусор и обращение с такими объектами, как морковь, губка и яблоко. Робот также был показан выполняющим кунг-фу и ползающим по полу, повторяя движения человека-демонстратора в реальном времени.
Оставшиеся вызовы
Несмотря на прогресс, SONIC по-прежнему остается исследовательской системой, и некоторые из самых сложных проблем в управлении гуманоидными роботами остаются нерешенными. Zhu сказал, что взаимодействия с большим количеством контактов и сильно ограниченные движения особенно сложны, особенно там, где существует разрыв между симуляцией и реальной производительностью.
«Nvidia улучшает это за счет более богатых обучающих данных, лучшей симуляции и domain randomization, а некоторые ограничения в конечном итоге зависят от физических возможностей робота», — сказал он.
Однако более серьезным испытанием станет то, смогут ли разработчики перенести эту конструкцию из контролируемых демонстраций в физические развертывания.
«Следующий шаг — продемонстрировать долгосрочную устойчивость, надежность и безопасность в различных реальных условиях», — сказал Zhu. «Для этого требуются более широкая валидация, улучшенный перенос из симуляции в реальность и производственные системы безопасности, интегрированные во весь robotics stack».
SONIC в рамках Nvidia
SONIC является частью более широкой кампании Nvidia по созданию базового технологического стека для physical AI.
Производитель чипов все активнее позиционирует робототехнику как продолжение своей AI-платформы, а экосистемы Isaac и Cosmos охватывают базовые модели для роботов, симуляцию, синтетические данные и инструменты для развертывания AI-моделей на физических машинах.
Хотя платформа Nvidia Isaac GR00T предназначена для интерпретации инструкций и определения того, что должен делать робот, SONIC переводит эти намерения в скоординированное физическое движение.
«SONIC — это основа движения, которая преобразует высокоуровневое намерение в скоординированное движение всего тела», — сказал Zhu. «Она связывает симуляцию и базовые модели, включая VLA-модели, с управлением роботом в реальном времени, обеспечивая повторно используемую политику для всего тела вместо необходимости нового низкоуровневого контроллера для каждой задачи».