新闻股票英伟达 SONIC 基础模型赋予人形机器人全身运动控制能力

英伟达 SONIC 基础模型赋予人形机器人全身运动控制能力

作者: AI Business·

要点速览

  • 英伟达的 SONIC 是一个为人形机器人提供全身控制的开源基础模型,已于 7 月发布用于远程操作和视觉-语言-动作驱动控制应用的检查点。
  • 该模型基于超过 1 亿帧动作捕捉数据训练而成,相当于约 700 小时的人类动作,参数规模从 120 万到 4200 万不等。
  • 在测试中,运行 SONIC 的机器人完成了将电钻放入盒子、丢弃汽水罐、抓取日常物品等任务,并在实时模仿人类演示者的同时表演功夫和爬行。
  • SONIC 的研究发表在《Science Robotics》上,该模型通过将 Isaac GR00T 平台的高层意图转化为协调的物理动作,融入英伟达的 Isaac 和 Cosmos 生态系统。
  • SONIC 仍是一个研究系统,英伟达研究员 Yuke Zhu 指出,富接触交互、仿真到现实的差距以及长期鲁棒性、可靠性与安全验证是主要的待解难题。
英伟达 SONIC 基础模型赋予人形机器人全身运动控制能力

如今,只需一个英伟达基础模型,就能教会人形机器人行走、奔跑、爬行、跳舞和操作物体。

英伟达的 SONIC(全称 "supersizing motion tracking for natural humanoid control",即面向自然人形控制的超大规模动作跟踪)旨在赋予人形机器人全身控制能力,使其能够协调各关节、保持平衡并实时调整动作。

这款开源轻量级基础模型现已公开发布,英伟达于 7 月发布了一个检查点,可用于远程操作和视觉-语言-动作(VLA)驱动控制等应用。SONIC 背后的研究也于本月发表在 Science Robotics 期刊上,这是英伟达推动该模型触达更多工程师的一部分。

不同于以往的机器人控制方式

语言和视觉模型的参数规模已迅速扩展至数十亿,并在海量数据集上训练,而用于控制人形机器人运动的模型却一直相对较小——只需少量 GPU 即可运行,且仅针对有限的行为集合进行调优。过去,为机器人增加一项新技能或新动作,通常需要构建一个全新的控制器,这也解释了为什么人形机器人在跨任务泛化方面落后于软件层面的 AI 模型。

SONIC 正是为改变这一局面而设计。该模型利用超过 1 亿帧动作捕捉数据(相当于约 700 小时的人类动作),构建出单一的机器人训练模型。

"全身控制要求每个关节协同运作,同时保持平衡、处理接触并实时适应不断变化的运动目标,"英伟达总监兼杰出研究科学家 Yuke Zhu 对 AI Business 表示。

工作原理

SONIC 已在三个维度上得到验证:模型规模、训练数据和计算量,训练模型的参数量从 120 万到 4200 万不等。由此得到的控制器既能跟踪多种动作,也能适应训练中未曾见过的动作。

在 Zhu 看来,这代表着人形机器人编程方式的转变。

他说:"SONIC 无需为单项技能手工设计控制器,而是通过大规模动作跟踪学习通用运动基础。同一套策略可由 VR、视频或 VLA 模型驱动,并能泛化到训练中未见过的行为。"

随着人形机器人从受控演示走向真实世界中不可预测的环境,这种灵活性将变得愈发重要——在这样的环境里,协调、平衡与恢复能力与目标任务本身同等重要。

在测试中,团队展示了 SONIC 完成的一系列任务,包括拿起电钻放入盒子、将汽水罐丢进垃圾桶,以及抓取胡萝卜、海绵和苹果等物体。机器人还在实时模仿人类演示者的同时,展示了功夫动作和地板爬行。

尚存的挑战

尽管取得了进展,SONIC 仍是一个研究系统,人形机器人控制中一些最棘手的问题尚未解决。Zhu 表示,富接触交互和高度受限的动作尤其具有挑战性,尤其是在仿真与真实世界表现之间存在差距的情况下。

他说:"英伟达正在通过更丰富的训练数据、更好的仿真和域随机化来改进这些问题,而一些限制最终取决于机器人自身的物理能力。"

更大的考验在于,开发者能否将该设计从受控演示转化为实际部署——在真实部署中,可重复性和安全性将成为核心要求,而非次要考量。

Zhu 说:"下一步是在多样化的真实世界环境中展示长期的鲁棒性、可靠性和安全性。这需要更广泛的验证、改进的仿真到现实(sim-to-real)迁移,以及贯穿整个机器人技术栈的生产级安全系统。"

SONIC 在英伟达框架中的定位

SONIC 是英伟达构建实体 AI 底层技术栈这一更宏大布局的一部分。这家芯片制造商日益将机器人业务定位为其 AI 平台的延伸,其 Isaac 和 Cosmos 生态系统涵盖机器人基础模型、仿真、合成数据以及在实体机器上部署 AI 模型的工具。

英伟达的 Isaac GR00T 平台负责解读指令、决定机器人应做什么,而 SONIC 则将这些意图转化为协调的物理动作。

Zhu 说:"SONIC 是将高层意图转化为协调全身动作的运动基础模型。它将仿真和基础模型(包括 VLA 模型)与实时机器人控制连接起来,提供可复用的全身策略,而无需为每项任务单独开发新的底层控制器。"