ActualitésActionsDyna Robotics dévoile DYNA-2, un modèle fondamental pour la robotique entraîné sur un million d'heures de vidéo humaine

Dyna Robotics dévoile DYNA-2, un modèle fondamental pour la robotique entraîné sur un million d'heures de vidéo humaine

Auteur: Cryptopolitan·

Points clés

  • DYNA-2 a été entraîné exclusivement sur des vidéos humaines égocentriques, ce que Dyna équivaut à environ 170 ans d'expérience continue.
  • Dyna rapporte que DYNA-2 a amélioré les taux de réussite sur les tâches de fabrication de haute précision, passant de 20 % à jusqu'à 80 % et 90 %.
  • Le modèle utilise une architecture World-Action qui prédit l'image vidéo suivante et la prochaine action lors du pré-entraînement.
  • Dyna affirme que le modèle peut être adapté à de nouvelles plateformes robotiques avec seulement quelques heures de réglage fin, incluant un exemple rapporté de 13 minutes pour dévisser un bouchon de bouteille.
  • Dyna a déjà déployé ses précédents robots DYNA-1 dans des environnements commerciaux tels que des hôtels, des restaurants, des laveries automatiques et des salles de sport.
Dyna Robotics dévoile DYNA-2, un modèle fondamental pour la robotique entraîné sur un million d'heures de vidéo humaine

Dyna Robotics a présenté DYNA-2 lundi, un nouveau modèle fondamental pour la robotique que l'entreprise affirme avoir été entraîné sur plus d'un million d'heures de vidéo humaine et zéro donnée robotique. L'entreprise basée aux États-Unis estime que cette approche pourrait répondre aux défis de coût et de scalabilité qui ont freiné la robotique polyvalente — un obstacle qui a maintenu l'IA physique en retrait par rapport à d'autres domaines où le pré-entraînement à grande échelle a déjà permis des avancées rapides.

Le goulot d'étranglement des données d'entraînement en robotique

Un obstacle persistant dans le développement de robots polyvalents est l'acquisition de données d'entraînement suffisantes. La plupart des robots actuels apprennent par téléopération, un processus dans lequel un opérateur humain guide manuellement la machine à travers des tâches pendant de nombreuses heures. Cette méthode est lente, coûteuse et difficile à adapter à grande échelle, ce qui limite en fin de compte les capacités de ces systèmes. Ce problème est largement reconnu dans l'industrie, avec des acteurs tels que Google DeepMind, Tesla et Physical Intelligence qui investissent massivement dans des stratégies de données alternatives pour leurs propres modèles fondamentaux de robotique.

DYNA-2 emprunte une voie différente en éliminant entièrement les données robotiques de la phase d'entraînement. Au lieu de cela, le modèle a été entraîné exclusivement sur des vidéos humaines égocentriques — des séquences enregistrées du point de vue d'une personne interagissant avec des objets et son environnement. Selon l'entreprise, cet ensemble de données représente environ 170 ans d'expérience continue.

Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, for the first time, we discovered several new scaling laws:

• world-action models exhibit scaling law on human data across four orders of magnitude, from 1000… pic.twitter.com/wZamR0axzS — Dyna Robotics (@DynaRobotics) August 10, 2026

Le cofondateur Jason Ma a expliqué la logique : « Les données d'action sont rares, mais la vidéo est partout. » Il a soutenu que l'intuition physique « peut être apprise directement à partir de vidéos humaines » plutôt que de nécessiter des millions d'heures de données collectées sur un bras robotique.

Sur les tâches de fabrication de haute précision, DYNA-2 a fait passer les taux de réussite de 20 % à entre 80 % et 90 %. Dyna attribue cette amélioration à l'ampleur du pré-entraînement vidéo. Sur 15 tâches de référence, les modèles entraînés sur des volumes plus importants de vidéos humaines ont systématiquement surpassé ceux entraînés sur des volumes plus réduits. Cette découverte fait écho aux lois de mise à l'échelle qui ont transformé le traitement du langage naturel, où les performances des modèles se sont améliorées de manière prévisible avec l'augmentation des données d'entraînement et de la puissance de calcul — bien que la question de savoir si ces principes s'appliquent pleinement aux tâches du monde physique reste ouverte.

En quoi l'architecture de DYNA-2 se distingue

Dyna se distingue par une architecture novatrice. Plutôt que de s'appuyer sur un modèle vision-langage — l'approche utilisée par des systèmes comme le RT-2 de Google — DYNA-2 est un World-Action Model basé sur la génération vidéo. Lors du pré-entraînement, le modèle prédit simultanément l'image vidéo suivante et la prochaine action. Dyna affirme que ce double objectif confère au modèle une compréhension interne de la physique de contact et du raisonnement spatial.

L'entreprise s'attend à ce que les connaissances transférées depuis les vidéos humaines se généralisent à différentes plateformes robotiques — y compris les bras stationnaires, les prototypes humanoïdes et les mains dextres — bien qu'aucun de ces appareils n'ait été impliqué dans le pré-entraînement. L'adaptation de DYNA-2 à une nouvelle plateforme nécessite, selon les rapports, seulement quelques heures de réglage fin au lieu de semaines de collecte de nouvelles données. Par exemple, Dyna indique que seulement 13 minutes de données de réglage fin ont permis à des mains robotiques de dévisser un bouchon de bouteille. Si ce transfert interplateformes se confirme lors d'évaluations indépendantes, cela pourrait considérablement réduire les obstacles au déploiement de robots performants sur diverses configurations matérielles.

Déploiement dans le monde réel et plans futurs

Dyna exploite déjà des robots dans des environnements commerciaux, un facteur qui la différencie de nombreux concurrents dans le domaine de la robotique. Les robots DYNA-1 de l'entreprise sont actuellement déployés dans des hôtels, des restaurants, des laveries automatiques et des salles de sport, selon les rapports. Cette expérience opérationnelle fournit à Dyna des retours de déploiement que de nombreuses entreprises de robotique axées sur la recherche ne possèdent pas.

Dyna a été fondée par Lindon Gao, York Yang et Jason Ma, qui ont précédemment travaillé chez DeepMind. La feuille de route affichée par l'entreprise consiste à étendre la même méthodologie d'entraînement à 10 millions d'heures de vidéo, en qualifiant cet objectif de défi de collecte de données plutôt que de construction de flotte. Alors que le secteur observe si le pré-entraînement basé sur la vidéo peut tenir ses promesses, les questions clés portent notamment sur la capacité des gains démontrés de DYNA-2 à se généraliser au-delà des tâches de référence vers des environnements réels imprévisibles, et sur la vitesse à laquelle les concurrents poursuivant des architectures alternatives pourront combler un éventuel écart.