新闻股票美国 Dyna Robotics 发布 DYNA-2 机器人基础模型,训练数据来自人类视频

美国 Dyna Robotics 发布 DYNA-2 机器人基础模型,训练数据来自人类视频

作者: Cryptopolitan·

要点速览

  • DYNA-2 仅使用自我视角的人类视频训练,Dyna 称其相当于约 170 年的不间断经验。
  • Dyna 报告称,DYNA-2 将高精度制造任务的成功率从 20% 提升至 80% 到 90%。
  • 该模型采用 World-Action 架构,在预训练期间同时预测下一帧视频和下一步动作。
  • Dyna 表示,该模型可在数小时内适配新的机器人平台,其中一个报告中的例子是仅用 13 分钟数据学会拧开瓶盖。
  • Dyna 早已将其较早的 DYNA-1 机器人部署到酒店、餐厅、自助洗衣店和健身房等商业场景。
美国 Dyna Robotics 发布 DYNA-2 机器人基础模型,训练数据来自人类视频

Dyna Robotics 周一推出了 DYNA-2,这是一款新的机器人基础模型。该公司表示,该模型基于超过一百万小时的人类视频训练,且未使用任何机器人数据。总部位于美国的这家公司认为,这种方法有望解决长期制约通用机器人发展的成本和可扩展性问题——在大型数据预训练已推动其他领域快速提升能力的背景下,物理 AI 在这一点上仍然落后。

机器人训练数据瓶颈

通用机器人开发中的一个持续障碍,是获取足够的训练数据。如今,大多数机器人通过遥操作学习,即由人工操作员在许多小时内手动引导机器完成任务。这种方法速度慢、成本高,而且难以扩展,最终限制了这类系统能够达到的能力上限。业内普遍认识到这一问题,包括 Google DeepMind、Tesla 和 Physical Intelligence 在内的企业都在为各自的机器人基础模型投入大量资源,探索替代性的数据策略。

DYNA-2 采取了不同路径,在训练阶段完全排除了机器人数据。取而代之的是,该模型只使用了自我视角的人类视频进行训练——也就是从人的第一视角记录其与物体及环境互动的影像。公司称,这些数据相当于约 170 年的不间断经验。

Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, for the first time, we discovered several new scaling laws:

• world-action models exhibit scaling law on human data across four orders of magnitude, from 1000… pic.twitter.com/wZamR0axzS — Dyna Robotics (@DynaRobotics) August 10, 2026

联合创始人 Jason Ma 解释了这一思路:“Action data is scarce, but video is everywhere.” 他认为,物理直觉“can be learned directly from human video”,而不必依赖在机器人机械臂上采集数百万小时的数据。

在高精度制造任务中,DYNA-2 的成功率从 20% 提升至 80% 到 90% 之间。Dyna 将这一改善归因于视频预训练的规模优势。在 15 项基准任务中,使用更多人类视频训练的模型始终优于使用较少人类视频训练的模型。这一发现呼应了改变自然语言处理的缩放定律——模型性能会随着训练数据和算力的增加而可预测地提升,不过这些原则是否能完全适用于物理世界任务,仍有待观察。

DYNA-2 的架构有何不同

Dyna 以其独特架构而区别于同类产品。DYNA-2 并未采用视觉语言模型——这也是 Google RT-2 等系统使用的方法——而是一种基于视频生成的 World-Action Model。在预训练过程中,它会同时预测下一帧视频和下一步动作。Dyna 表示,这一双重目标使模型具备了对接触物理和空间推理的内部理解。

公司预计,从人类视频中迁移得到的知识可以泛化到不同的机器人平台——包括固定机械臂、人形原型和灵巧手——尽管这些设备并未参与预训练。将 DYNA-2 适配到新的平台,据称只需数小时微调,而不需要数周采集新数据。例如,Dyna 报告称,仅 13 分钟的微调数据就让机器人手能够拧下瓶盖。如果这种跨平台迁移能力经独立验证成立,可能会显著降低在不同硬件配置上部署高能力机器人的门槛。

真实世界部署与未来计划

Dyna 已经在商业环境中运营机器人,这使其区别于许多机器人领域的同行。据报道,公司的 DYNA-1 机器人目前已部署在酒店、餐厅、自助洗衣店以及健身房等场景中。这些运营经验为 Dyna 提供了许多研究型机器人公司所缺乏的部署反馈。

Dyna 由 Lindon Gao、York Yang 和 Jason Ma 创立,后两者此前曾在 DeepMind 工作。公司公开的路线图是将同样的训练方法扩展到 1000 万小时的视频,并将其视为数据采集问题,而非扩充机器人机队的问题。随着业界观察基于视频的预训练能否兑现承诺,一个关键问题是:DYNA-2 已展示的提升能否从基准任务泛化到不可预测的真实世界环境,以及采用其他架构的竞争者能多快缩小差距。