NieuwsMacroReward AI introduceert OM-1, een robotisch foundationmodel dat manipulatie rechtstreeks van menselijke data leert

Reward AI introduceert OM-1, een robotisch foundationmodel dat manipulatie rechtstreeks van menselijke data leert

Auteur: Metaverse Post·

Belangrijkste punten

  • Reward AI heeft OM-1 geïntroduceerd, een robotisch foundationmodel dat uitsluitend is getraind op menselijke manipulatiegegevens, zonder gebruik van teleoperatie of ervaring op de robot tijdens de training.
  • Naar verluidt generaliseert het model zero-shot over verschillende robotlichamen, waaronder tafelarmen, industriële armen en humanoïden, zonder robot-specifieke fijnafstelling.
  • Demonstraties worden vastgelegd met de Omnibody Hand, een draagbaar apparaat met zeven vrijheidsgraden, gebaseerd op het eerdere Stanford-onderzoek DexCap en ontworpen rond functionele greepcapaciteiten in plaats van het nabootsen van handgewrichten.
  • De One Data Interface combineert tactiele feedback, nabijheidssensoren, in-hand camera's met globale sluiter en elektromagnetische handhoudetracking; Reward AI zegt dat het toevoegen van elektromagnetische sensing de gemiddelde overschietfout met 60% verminderde bij hoge snelheid in gecontroleerde tests.
  • Het bedrijf stelt dat OM-1 volledig nieuwe taken kan leren, waaronder taken met uitdagende dynamica en lange tijdshorizonten, vanuit minder dan 30 minuten data, al komen de gerapporteerde cijfers uit eigen tests.
Reward AI introduceert OM-1, een robotisch foundationmodel dat manipulatie rechtstreeks van menselijke data leert

Reward AI heeft OM-1 geïntroduceerd, een algemeen inzetbaar robotisch foundationmodel dat is ontworpen om fysieke intelligentie rechtstreeks uit menselijke manipulatiegegevens te verkrijgen. Volgens de officiële aankondiging van het bedrijf kan het systeem zero-shot generaliseren over verschillende robotlichamen — waaronder tafelarmen, industriële armen en humanoïden — zonder teleoperatiegegevens, training op de robot of robot-specifieke fijnafstelling. Juist dat laatste punt is waar veel van de betekenis ligt: teleoperatie, waarbij een mens een robot bestuurt om demonstraties op te nemen, is lange tijd een standaardmethode voor gegevensverzameling in manipulatieonderzoek geweest, en het koppelt elke opname aan een specifieke machine.

De hardwarebasis van het systeem is de Omnibody Hand, een draagbaar apparaat met zeven vrijheidsgraden, gebouwd op DexCap, het eerdere onderzoek van het team aan Stanford. In plaats van de menselijke hand gewricht voor gewricht na te bootsen, is het apparaat ontworpen rond functionele capaciteiten: het selecteren van nuttige contactpunten, het heroriënteren van objecten in de handpalm en het soepel wisselen tussen precisie- en krachtgrepen. Een ergonomisch ontwerp houdt rekening met variaties in handgrootte en vingerproporties, zodat opgenomen bewegingen natuurlijk, ongecompenseerd menselijk gedrag weerspiegelen.

Bovenop deze hardware bevindt zich de "One Data Interface"-laag, die hoogfrequente tactiele feedback, nabijheidssensoren, in-hand camera's met globale sluiter en eleromagnetische handhoudetracking combineert om demonstraties op volledig menselijk tempo vast te leggen. Reward AI meldt dat het aanvullen van visueel-inertiële tracking met elektromagnetische sensing de gemiddelde overschietfout met 60% verminderde bij hoge snelheid in gecontroleerde tests. Ook krachtgegevens worden langs trajecten opgenomen, zodat demonstraties zowel het pad van een beweging als de erachter zittende inspanning coderen.

Leren van mensen, niet van robots

OM-1 is uitsluitend getraind op menselijke data. Volgens Reward AI wordt noch teleoperatie noch enige ervaring op de robot gebruikt tijdens de training; in plaats daarvan leert het beleid robotacties rechtstreeks uit menselijke beweging te genereren, waarbij wat het team omschrijft als onderbewuste fysieke intelligentie wordt gedistilleerd in één enkel, verenigd model. Omdat alle demonstraties via dezelfde data-interface binnenkomen, zijn pre-training en post-training samengevoegd tot één fase — nieuwe data vereist geen herverzameling en geen aparte trainingspijplijn per robot, taak of inzet. Deze vorm van overdracht tussen verschillende robotlichamen is al lang een doelstelling in robotleren, waar manipulatiebeleid doorgaans per platform werd getraind en afgesteld.

Architecturaal verwerkt OM-1 elke sensorische modaliteit — beelden, tactiele signalen, nabijheid tussen vingers en handhoudetrajecten — op de oorspronkelijke bemonsteringsfrequentie, waardoor hoogfrequente contactinformatie behouden blijft naast langzamere visuele context. Een temporele geschiedenis van deze stromen stelt het beleid in staat te redeneren over hoe contact en taakvoortgang zich in de tijd ontwikkelen. Onder het model vertaalt een op reinforcement learning gebaseerde besturingslaag die op hoge frequentie draait acties naar activering voor elk gegeven lichaam, waarbij dynamica, verstoringen en systeemvertragingen worden gecompenseerd en overgangen tussen opeenvolgende beleidsvoorspellingen worden geoptimaliseerd om de beweging bij snelheid soepel te houden.

In zijn conclusie stelt het bedrijf dat OM-1 volledig nieuwe taken kan oppakken — waaronder taken met uitdagende dynamica en lange tijdshorizonten — vanuit minder dan 30 minuten data. Indien gevalideerd, positioneert de aanpak het vastleggen van menselijke demonstraties, sensing, leren, inferentie en besturing als één geïntegreerde stack — een stack die het bedrijf omschrijft als toekomstbestendig voor robothardware die moet worden ontworpen. In lijn met die kanttekening komen de gerapporteerde cijfers — de 60% verbetering in tracking en taakleren in minder dan 30 minuten — uit de eigen rapportage en gecontroleerde tests van het bedrijf; prestaties op onbekende robotlichamen in echte inzet zijn de logische volgende test van deze stack-benadering.

Bron: Metaverse Post