ニュースマクロReward AI、人間のデータから直接操作を学ぶロボット基盤モデルOM-1を発表

Reward AI、人間のデータから直接操作を学ぶロボット基盤モデルOM-1を発表

著者: Metaverse Post·

重要ポイント

  • Reward AIは、人間の操作データのみで訓練されたロボット基盤モデルOM-1を発表した。訓練にはテレオペレーションやロボット上での経験は一切使用されていない。
  • 同モデルは、テーブルトップ用アーム、産業用アーム、ヒューマノイドを含むさまざまなロボットボディに対し、ロボット固有のファインチューニングなしでゼロショットで汎化できると報告されている。
  • デモンストレーションは、チームのスタンフォード大学での先行研究DexCapに基づく自由度7のウェアラブルデバイス「Omnibody Hand」で収集され、手の関節を再現するのではなく機能的な把握能力を中心に設計されている。
  • One Data Interfaceは触覚フィードバック、近接センシング、グローバルシャター式ハンド内カメラ、電磁式手姿勢トラッキングを組み合わせており、Reward AIによれば電磁センシングの追加により、制御されたテストでの高速時の平均オーバーシュート誤差が60%削減されたという。
  • 同社は、OM-1が困難なダイナミクスや長期ホライズンを含む新しいタスクを30分未満のデータから学習できると述べているが、報告された数値は同社自身のテストに基づくものである。
Reward AI、人間のデータから直接操作を学ぶロボット基盤モデルOM-1を発表

Reward AIは、人間の操作データから直接フィジカルインテリジェンスを獲得するよう設計された汎用ロボット基盤モデル「OM-1」を発表した。同社の公式発表によると、このシステムは、テレオペレーションデータ、ロボット上でのトレーニング、ロボット固有のファインチューニングを一切使用せずに、テーブルトップ用アーム、産業用アーム、ヒューマノイドを含むさまざまなロボットボディに対してゼロショットで汎化できるという。この最後の点こそが重要である:人間がロボットを操作してデモンストレーションを記録するテレオペレーションは、マニピュレーション研究における長年の標準的なデータ収集手法であり、すべての記録を特定のマシンに紐付けてきた。

システムのハードウェア基盤は、チームがスタンフォード大学で行った先行研究DexCapに基づく、自由度7のウェアラブルデバイス「Omnibody Hand」である。このデバイスは、人間の手を関節単位で再現するのではなく、機能的な能力を中心に設計されている:有用な接触点の選択、掌の中での物体の向き変更、精度把握とパワー把握のスムーズな切り替えである。人間工学的なフィット感により手の大きさや指の比率のばらつきに対応し、記録される動作が自然な、代償動作のない人間の挙動を反映することを保証している。

このハードウェアの上に、「One Data Interface」層が配置されている。この層は、高頻度の触覚フィードバック、近接センシング、グローバルシャター式ハンド内カメラ、電磁式手姿勢トラッキングを組み合わせ、人の全速力でのデモンストレーションを収集する。Reward AIは、視覚慣性トラッキングに電磁センシングを追加することで、制御されたテストにおける高速時の平均オーバーシュート誤差が60%削減されたと報告している。また、力のデータも軌道に沿って記録されるため、デモンストレーションは動作の経路とその背後にある力の両方を符号化する。

ロボットからではなく、人間から学ぶ

OM-1は人間のデータのみで訓練されている。Reward AIによると、訓練中にテレオペレーションやロボット上での経験は一切使用されず、ポリシーは人間の動きから直接ロボットのアクションを生成することを学習し、チームが「無意識的なフィジカルインテリジェンス」と呼ぶものを単一の統合モデルに蒸留する。すべてのデモンストレーションが同じデータインターフェースを通じて供給されるため、事前学習と事後学習は単一のステージに統合され、新しいデータには再収集が不要で、ロボット・タスク・デプロイメントごとに個別のトレーニングパイプラインも必要ない。この種のクロスエンボディメント転移は、マニピュレーションポリシーが従来1つのプラットフォームごとに訓練・調整されてきたロボット学習における長年の目標であった。

アーキテクチャ上、OM-1は各感覚モダリティ(画像、触覚信号、指間近接、手姿勢軌道)をそれぞれのネイティブなサンプリングレートで処理し、より遅い視覚コンテキストとともに高頻度の接触手がかりを保持する。これらのストリームの時間履歴により、ポリシーは接触やタスクの進行が時間とともにどう変化するかを推論できる。モデルの下層には、高頻度で動作する強化学習ベースの制御層があり、任意のボディに対してアクションをアクチュエーションに変換し、ダイナミクス、外乱、システム遅延を補償しながら、連続するポリシー予測間の遷移を最適化して高速時でも動作を滑らかに保つ。

結論として同社は、OM-1が30分未満のデータから、困難なダイナミクスや長期ホライズンを含むまったく新しいタスクを習得できると述べている。検証が進めば、このアプローチは人間のデモ収、センシング、学習、推論、制御を単一の統合スタックとして位置づけるものであり、同社はこれを、まだ設計されていないロボットハードウェアにも対応する将来性のあるものとして提示している。その留保と一貫して、報告された数値(60%のトラッキング改善と30分未満でのタスク学習)は同社自身の報告と制御されたテストに基づくものであり、実際のデプロイメントにおける未知のロボットボディ全体での性能が、この単一スタックの構想の次の試金石となる。

出典:Metaverse Post