ActualitésMacroReward AI dévoile OM-1, un modèle fondamental pour robots qui apprend la manipulation directement à partir de données humaines

Reward AI dévoile OM-1, un modèle fondamental pour robots qui apprend la manipulation directement à partir de données humaines

Auteur: Metaverse Post·

Points clés

  • Reward AI a dévoilé OM-1, un modèle fondamental pour robots entraîné exclusivement sur des données de manipulation humaines, sans téléopération ni expérience sur robot pendant l'entraînement.
  • Le modèle devrait généraliser en zero-shot sur différents corps de robots, y compris des bras de table, des bras industriels et des humanoïdes, sans fine-tuning spécifique à chaque robot.
  • Les démonstrations sont capturées avec l'Omnibody Hand, un dispositif portable à sept degrés de liberté construit sur les travaux antérieurs de l'équipe à Stanford (DexCap) et conçu autour de capacités de préhension fonctionnelles plutôt que de répliquer les articulations de la main.
  • La One Data Interface combine retour tactile, détection de proximité, caméras globales en main et suivi électromagnétique de la pose de la main ; Reward AI indique que l'ajout du suivi électromagnétique a réduit de 60 % l'erreur moyenne de dépassement à haute vitesse lors de tests contrôlés.
  • L'entreprise affirme qu'OM-1 peut apprendre des tâches entièrement nouvelles, y compris avec une dynamique difficile et des horizons longs, à partir de moins de 30 minutes de données, bien que les chiffres rapportés proviennent de ses propres tests.
Reward AI dévoile OM-1, un modèle fondamental pour robots qui apprend la manipulation directement à partir de données humaines

Reward AI a dévoilé OM-1, un modèle fondamental pour robots à usage général conçu pour acquérir une intelligence physique directement à partir de données de manipulation humaines. Selon l'annonce officielle de l'entreprise, le système peut généraliser en zero-shot sur différents corps de robots — y compris des bras de table, des bras industriels et des humanoïdes — sans données de téléopération, d'entraînement sur robot ni de fine-tuning spécifique à chaque robot. C'est sur ce dernier point que réside une grande partie de l'importance de l'annonce : la téléopération, dans laquelle un humain pilote un robot pour enregistrer des démonstrations, est depuis longtemps une méthode standard de collecte de données en recherche de manipulation, et elle lie chaque enregistrement à une machine spécifique.

Le socle matériel du système est l'Omnibody Hand, un dispositif portable à sept degrés de liberté construit sur la base de DexCap, les travaux antérieurs de l'équipe à Stanford. Plutôt que de répliquer la main humaine articulation par articulation, le dispositif est conçu autour de capacités fonctionnelles : sélectionner des points de contact utiles, réorienter des objets dans la paume et passer en douceur entre préhension de précision et préhension de puissance. Un ajustement ergonomique s'adapte aux variations de taille de main et de proportions des doigts, garantissant que les mouvements enregistrés reflètent un comportement humain naturel, non compensé.

Au-dessus de ce matériel se trouve la couche « One Data Interface », qui combine retour tactile haute fréquence, détection de proximité, caméras globales en main et suivi électromagnétique de la pose de la main pour capturer des démonstrations au rythme humain complet. Reward AI rapporte que l'ajout du suivi électromagnétique au suivi visuo-inertiel a réduit de 60 % l'erreur moyenne de dépassement à haute vitesse lors de tests contrôlés. Les données de force sont également enregistrées le long des trajectoires, si bien que les démonstrations encodent à la fois le chemin d'un mouvement et l'effort qui le sous-tend.

Apprendre des humains, pas des robots

OM-1 est entraîné exclusivement sur des données humaines. Selon Reward AI, ni la téléopération ni aucune expérience sur robot ne sont utilisées pendant l'entraînement ; la politique apprend plutôt à générer des actions robotiques directement à partir du mouvement humain, distillant ce que lquipe décrit comme une intelligence physique subconsciente dans un modèle unique et unifié. Comme toutes les démonstrations arrivent par la même interface de données, le pré-entraînement et le post-entraînement sont fusionnés en une seule étape — de nouvelles données ne nécessitent ni recollecte ni pipeline d'entraînement séparé par robot, tâche ou déploiement. Ce type de transfert inter-corporel est un objectif de longue date de l'apprentissage robotique, où les politiques de manipulation ont généralement été entraînées et ajustées pour une plateforme à la fois.

Sur le plan architectural, OM-1 traite chaque modalité sensorielle — images, signaux tactiles, proximité inter-doigts et trajectoires de pose de la main — à sa fréquence d'échantillonnage native, préservant les indices de contact haute fréquence aux côtés du contexte visuel plus lent. Un historique temporel de ces flux permet à la politique de raisonner sur l'évolution du contact et de la progression de la tâche. En dessous du modèle, une couche de contrôle fondée sur l'apprentissage par renforcement, fonctionnant à haute fréquence, traduit les actions en actionnement pour n'importe quel corps, compensant la dynamique, les perturbations et les délais système tout en optimisant les transitions entre prédictions successives de la politique pour garder un mouvement fluide à haute vitesse.

Dans sa conclusion, l'entreprise indique qu'OM-1 peut apprendre des tâches entièrement nouvelles — y compris celles impliquant une dynamique difficile et des horizons longs — à partir de moins de 30 minutes de données. Si l'approche est validée, elle positionne la capture de démonstrations humaines, la perception, l'apprentissage, l'inférence et le contrôle comme une seule pile intégrée — un ensemble que l'entreprise présente comme pérenne pour du matériel robotique qui reste encore à concevoir. En cohérence avec cette réserve, les chiffres rapportés — l'amélioration de 60 % du suivi et l'apprentissage de tâches en moins de 30 minutes — proviennent des propres tests et rapports de l'entreprise ; les performances sur des corps de robots inconnus en déploiement réel constitueront le test naturel de cette vision de pile unique.

Source : Metaverse Post