Reward AI 发布 OM-1:直接从人类数据学习操作的机器人基础模型
要点速览
- •Reward AI 发布了 OM-1,这是一个完全使用人类操作数据训练的机器人基础模型,训练过程中未使用遥操作或机器人本体经验。
- •据报道,该模型无需针对特定机器人的微调,即可在不同机器人本体(包括桌面机械臂、工业机械臂和人形机器人)之间实现零样本泛化。
- •演示数据通过 Omnibody Hand 采集,这是一款基于团队此前斯坦福 DexCap 研究打造、具有七个自由度的可穿戴设备,围绕功能性抓握能力而非逐关节复制手部而设计。
- •One Data Interface 结合了触觉反馈、接近感知、全局快门手持相机和电磁手部姿态追踪;Reward AI 称,增加电磁感知后,在受控高速测试中将平均超调误差降低了 60%。
- •该公司表示,OM-1 可以从不到 30 分钟的数据中学习全新任务,包括涉及挑战性动力学和长时程的任务,不过所报告的数据均来自其自身的测试。

Reward AI 发布了 OM-1,这是一个通用机器人基础模型,旨在直接从人类操作数据中获取物理智能。根据该公司的官方公告,该系统无需遥操作数据、机器人本体训练或针对特定机器人的微调,即可在不同机器人本体——包括桌面机械臂、工业机械臂和人形机器人——之间实现零样本泛化。最后这一点正是其重要意义所在:遥操作是指由人类操控机器人以录制演示数据,长期以来一直是操作研究中的标准数据采集方法,而它使每一次录制都与特定机器绑定。
该系统的硬件基础是 Omnibody Hand,一款基于团队此前在斯坦福大学的 DexCap 研究打造、具有七个自由度的可穿戴设备。该设备并非逐关节复制人类手部,而是围绕功能能力进行设计:选择有效的接触点、在手掌内重新定向物体,以及在精密抓握和强力抓握之间平滑切换。符合人体工程学的贴合设计可适应手部大小和手指比例的差异,确保录制的动作反映自然、未经补偿的人类行为。
在这一硬件之上是"One Data Interface"层,它结合了高频触觉反馈、接近感知、全局快门手持相机和电磁手部姿态追踪,以完整的人类速度采集演示数据。Reward AI 报告称,在受控测试中,通过电磁感知增强视觉惯性追踪,在高速下将平均超调误差降低了 60%。力数据也沿轨迹进行记录,因此演示既编码了运动路径,也编码了路径背后的施力。
向人类学习,而非向机器人学习
OM-1 完全使用人类数据进行训练。据 Reward AI 介绍,训练过程中既不使用遥操作,也不使用任何机器人本体经验;策略改为直接从人类动作生成机器人行为,将团队所描述的潜意识物理智能提炼到单一统一模型中。由于所有演示都通过同一数据接口传入,预训练和后训练被合并为单一阶段——新数据无需重新采集,也无需针对每个机器人、任务或部署环境建立单独的训练流程。这种跨本体的能力迁移一直是机器人学习领域的长期目标,此前操作策略通常需要针对单个平台进行训练和调优。
在架构上,OM-1 以每种感官模态的原生采样率处理数据——包括图像、触觉信号、指间接近感知和手部姿态轨迹——在较慢的视觉上下文旁保留高频接触线索。这些数据流的时间历史使策略能够推断接触状态和任务进展如何随时间演变。在模型之下,一个以高频运行的基于强化学习的控制层将动作转换为适用于任意本体的执行指令,补偿动力学特性、扰动和系统延迟,同时优化连续策略预测之间的过渡,以保持高速下的运动平滑。
该公司在结论中表示,OM-1 可以从不到 分钟的数据中学会全新任务——包括涉及挑战性动力学和长时程的任务。如果得到验证,该方法将把人类演示采集、感知、学习、推理和控制定位为单一集成堆栈——该公司将其称为对未来尚待设计的机器人硬件具有前瞻适应性。与这一谨慎表述一致,所报告的数据——60% 的追踪改进和不到 30 分钟的任务学习——均来自该公司自己的报告和受控测试;该单一堆栈构想的下一个自然检验,将是在真实部署中面对陌生机器人本体时的表现。