Reward AI stellt OM-1 vor: Roboter-Foundation-Modell lernt Manipulation direkt aus menschlichen Daten
Wichtige Erkenntnisse
- •Reward AI hat OM-1 vorgestellt, ein Roboter-Foundation-Modell, das ausschließlich mit menschlichen Manipulationsdaten trainiert wird; weder Teleoperation noch Erfahrung am Roboter flossen in das Training ein.
- •Das Modell generalisiert laut Unternehmensangaben Zero-Shot über verschiedene Roboterplattformen hinweg – darunter Tischarme, Industriearme und Humanoide – ohne robotspezifisches Fine-Tuning.
- •Die Demonstrationen werden mit dem Omnibody Hand erfasst, einem tragbaren Gerät mit sieben Freiheitsgraden, das auf der früheren DexCap-Forschung des Teams an der Stanford University basiert und auf funktionale Greiffähigkeiten statt auf die Nachbildung von Handgelenken ausgelegt ist.
- •Das One Data Interface kombiniert taktile Rückmeldung, Näherungssensorik, Global-Shutter-Kameras in der Hand und elektromagnetisches Handhaltungs-Tracking; laut Reward AI reduzierte die ergänzende elektromagnetische Sensorik in kontrollierten Tests den mittleren Überschwingfehler um 60 %.
- •Das Unternehmen erklärt, OM-1 könne völlig neue Aufgaben – einschließlich solcher mit anspruchsvoller Dynamik und langen Horizonten – aus weniger als 30 Minuten Daten lernen, wobei die berichteten Zahlen aus den eigenen Tests stammen.

Reward AI hat OM-1 vorgestellt, ein universelles Roboter-Foundation-Modell, das physische Intelligenz direkt aus menschlichen Manipulationsdaten gewinnen soll. Laut der offiziellen Ankündigung des Unternehmens kann das System Zero-Shot über verschiedene Roboterplattformen hinweg generalisieren – darunter Tischarme, Industriearme und Humanoide – ohne Teleoperationsdaten, Training am Roboter oder robotspezifisches Fine-Tuning. Genau an diesem Punkt liegt viel von der Bedeutung: Teleoperation, bei der ein Mensch einen Roboter steuert, um Demonstrationen aufzuzeichnen, ist seit Langem eine Standardmethode der Datenerhebung in der Manipulationsforschung – und bindet jede Aufzeichnung an eine bestimmte Maschine.
Die Hardware-Grundlage des Systems ist der Omnibody Hand, ein tragbares Gerät mit sieben Freiheitsgraden, das auf DexCap basiert, der früheren Forschungsarbeit des Teams an der Stanford University. Statt die menschliche Hand Gelenk für Gelenk nachzubilden, ist das Gerät um funktionale Fähigkeiten herum konzipiert: das Auswählen nützlicher Kontakt Punkte, das Umorientieren von Objekten in der Handfläche und der fließende Übergang zwischen Präzisions- und Kraftgriff. Eine ergonomische Passform berücksichtigt Unterschiede bei Handgröße und Fingerproportionen, sodass die aufgezeichneten Bewegungen natürliches, nicht kompensiertes menschliches Verhalten widerspiegeln.
Auf dieser Hardware sitzt die „One Data Interface“-Schicht, die hochfrequente taktile Rückmeldung, Näherungssensorik, Global-Shutter-Kameras in der Hand und elektromagnetisches Handhaltungs-Tracking kombiniert, um Demonstrationen in vollem menschlichem Tempo aufzuzeichnen. Reward AI berichtet, dass Ergänzung des visuell-inertialen Trackings durch elektromagnetische Sensorik in kontrollierten Tests den mittleren Überschwingfehler bei hoher Geschwindigkeit um 60 % reduzierte. Zudem werden Kraftdaten entlang der Trajektorien aufgezeichnet, sodass die Demonstrationen sowohl den Weg einer Bewegung als auch die dahinterstehende Kraftstufe erfassen.
Lernen von Menschen, nicht von Robotern
OM-1 wird ausschließlich mit menschlichen Daten trainiert. Laut Reward AI werden weder Teleoperation noch jegliche Erfahrung am Roboter beim Training verwendet; stattdessen lernt die Policy, Roboteraktionen direkt aus menschlicher Bewegung zu erzeugen, indem sie das, was das Team als unterbewusste physische Intelligenz beschreibt, in ein einziges, einheitliches Modell destilliert. Da alle Demonstrationen über dasselbe Dateninterface einlaufen, sind Pre-Training und Post-Training zu einer einzigen Phase verschmolzen – neue Daten erfordern keine erneute Erhebung und keine separate Trainingspipeline pro Roboter, Aufgabe oder Einsatzumgebung. Ein solcherEmbodiment-übergreifender Transfer ist ein langjähriges Ziel des robotischen Lernens, wo Manipulations-Policen typischerweise jeweils für eine einzelne Plattform trainiert und abgestimmt wurden.
Architektonisch verarbeitet OM-1 jede sensorische Modalität – Bilder, taktile Signale, Fingerabstands- Näherung und Handhaltungstrajektorien – mit ihrer nativen Abtastrate und bewahrt so hochfrequente Kontaktsignale neben dem langsameren visuellen Kontext. Eine zeitliche Historie dieser Streams ermöglicht der Policy, nachzuvollziehen, wie sich Kontakt und Aufgabenfortschritt im Zeitverlauf entwickeln. Darunter übersetzt eine auf Reinforcement Learning basierende Steuerungsschicht, die mit hoher Frequenz läuft, Aktionen in Antriebsbefehle für jeden beliebigen Körper, kompensiert Dynamik, Störungen und Systemverzögerungen und optimiert die Übergänge zwischen aufeinanderfolgenden Policy-Vorhersagen, um die Bewegung bei hoher Geschwindigkeit flüssig zu halten.
Zum Abschluss erklärt das Unternehmen, OM-1 könne völlig neue Aufgaben – darunter solche mit anspruchsvoller Dynamik und langen Zeithorizonten – aus weniger als 30 Minuten Daten erlernen. Wenn sich der Ansatz bestätigt, positioniert er die Erfassung menschlicher Demonstrationen, Sensorik, Lernen, Inferenz und Steuerung als einen einzigen integrierten Stack – einen, den das Unternehmen als zukunftssicher für noch gar nicht entworfene Roboterhardware darstellt. Im Einklang mit dieser Einschränkung stammen die berichteten Zahlen – die 60 %ige Verbesserung beim Tracking und das Aufgabenlernen in unter 30 Minuten – aus den eigenen Angaben kontrollierten Tests des Unternehmens; die Leistung über unbekannte Roboterplattformen hinweg in realen Einsätzen ist der naheliegende nächste Test für das Single-Stack-Konzept.
Quelle: Metaverse Post