Dyna RoboticsがDYNA-2を公開—100万時間の人間の動画で訓練されたロボット基盤モデル
重要ポイント
- •DYNA-2は一人称視点の人間の動画のみで訓練されており、Dynaはこれを約170年分の連続した経験に相当すると述べています。
- •Dynaは、DYNA-2が高精度製造タスクの成功率を20%から最大80%〜90%に向上させたと報告しています。
- •このモデルは、事前訓練中に次の動画フレームと次のアクションを予測するWorld-Actionアーキテクチャを使用しています。
- •Dynaは、このモデルがわずか数時間のファインチューニングで新しいロボットプラットフォームに適応できると述べており、ボトルキャップを開けるための13分間の事例も報告されています。
- •Dynaはすでに前世代のDYNA-1ロボットをホテル、レストラン、ランドリー、ジムなどの商業環境に展開しています。

Dyna Roboticsは月曜日に、100万時間以上の人間の動画データと一切のロボットデータなしで訓練された新しいロボット基盤モデル「DYNA-2」を発表しました。米国に拠点を置く同社は、このアプローチが汎用ロボット分野に立ちはだかるコストとスケーラビリティの課題を解決し得ると考えています。この課題は、大規模データの事前訓練がすでに急速な能力向上を実現している他の領域において、物理AIを後れをとらせてきた障壁となっています。
ロボット工学における訓練データのボトルネック
汎用ロボットの開発における継続的な障害は、十分な訓練データの確保です。現在のほとんどのロボットは遠隔操作を通じて学習します。これは人間のオペレーターが何時間もかけて手動で機械をタスクに沿って誘導するプロセスです。この手法は遅く、費用がかかり、スケールが困難であり、結果としてシステムの能力向上に上限を設けてしまいます。この問題は業界全体で広く認識されており、Google DeepMind、Tesla、Physical Intelligenceを含む各社が独自のロボット基盤モデル向けの代替データ戦略に巨額の投資を行っています。
DYNA-2は、訓練フェーズからロボットデータを完全に排除するという異なるアプローチをとります。代わりに、このモデルは一人称視点の人間の動画のみで訓練されました。これは、人が物体や環境と相互作用する様子をその人の視点から録画した映像です。同社によると、このデータセットは約170年分の連続した経験に相当します。
Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, for the first time, we discovered several new scaling laws:
• world-action models exhibit scaling law on human data across four orders of magnitude, from 1000… pic.twitter.com/wZamR0axzS — Dyna Robotics (@DynaRobotics) August 10, 2026
共同創業者のJason Maはその理由について次のように説明しました。「アクションデータは希少ですが、動画は至る所に存在します」。彼は、物理的な直感は「ロボットアームで数百万時間のデータを収集するのではなく、人間の動画から直接学習できる」と主張しました。
高精度製造タスクにおいて、DYNA-2は成功率を20%から80%〜90%へと向上させました。Dynaはこの改善を、動画の事前訓練の圧倒的な規模に起因するとしています。15のベンチマークタスクにおいて、より多くの人間の動画で訓練されたモデルは、より少ない動画で訓練されたモデルを一貫して上回りました。この発見は、自然言語処理を変革したスケーリング則と共鳴するものです。自然言語処理では、訓練データと計算量の増加に伴いモデルの性能が予測可能に向上しました。ただし、これらの原理が物理世界のタスクに完全に適用されるかどうかは、未解決の課題です。
DYNA-2のアーキテクチャの違い
Dynaはその斬新なアーキテクチャによって際立っています。GoogleのRT-2などのシステムが採用するビジョン・言語モデルではなく、DYNA-2は動画生成に基づくWorld-Action Modelです。事前訓練中、モデルは次の動画フレームと次のアクションを同時に予測します。Dynaは、この二重の目標がモデルに接触物理学と空間推論に関する内的理解を与えると述べています。
同社は、人間の動画から転移された知識が、事前訓練に使用されなかった異なるロボットプラットフォーム(固定式アーム、ヒューマノイドプロトタイプ、器用なハンドなど)にも一般化されると期待しています。DYNA-2を新しいプラットフォームに適応させるには、新たなデータ収集に数週間かけるのではなく、わずか数時間のファインチューニングで済むと報告されています。例えば、Dynaはわずか13分のファインチューニングデータでロボットハンドがボトルキャップをひねって開けることができるようになったと報告しています。このクロスプラットフォーム転移が独立した評価の下で成立する場合、多様なハードウェア構成全体に高性能なロボットを展開する壁を大幅に下げる可能性があります。
実世界での展開と今後の計画
Dynaはすでに商業環境でロボットを運用しており、これはロボット工学分野の多くの同業他社との差別化要因となっています。報道によると、同社のDYNA-1ロボットは現在、ホテル、レストラン、ランドリー、ジムなどに展開されています。この運用経験は、Dynaに多くの研究志向のロボット企業には欠けている展開フィードバックを提供しています。
Dynaは、以前DeepMindで働いていたLindon Gao、York Yang、Jason Maによって創業されました。同社の発表したロードマップでは、同じ訓練手法を1000万時間の動画に拡張することを目指しており、これを艦隊構築の課題ではなくデータ収集の課題と位置づけています。動画ベースの事前訓練がその約束を果たせるかどうかを業界が注視する中、重要な問いには、DYNA-2の実証された成果がベンチマークタスクを超えて予測不可能な実世界の環境に一般化されるかどうか、そして代替アーキテクチャを追求する競合他社がギャップをどれほど早く埋められるかが含まれます。