Reward AI zaprezentował OM-1 — model fundamentowy dla robotów uczący się manipulacji bezpośrednio z danych ludzkich
Najważniejsze informacje
- •Reward AI zaprezentował OM-1, model fundamentowy dla robotów trenowany wyłącznie na ludzkich danych manipulacyjnych, bez teleoperacji ani doświadczenia na robocie podczas treningu.
- •Według doniesień model generalizuje zero-shot na różnych korpusach robotów, w tym ramionach stołowych, ramionach przemysłowych i humanoidach, bez strojenia dla konkretnego robota.
- •Demonstracje są rejestrowane za pomocą Omnibody Hand, noszonego urządzenia o siedmiu stopniach swobody, opartego na wcześniejszych badaniach DexCap zespołu na Stanfordzie i zaprojektowanego wokół funkcjonalnych możliwości chwytania, a nie odwzorowywania stawów dłoni.
- •One Data Interface łączy sprzężenie dotykowe, czujniki zbliżeniowe, kamery global-shutter w dłoni oraz elektromagnetyczne śledzenie pozycji dłoni, a Reward AI podaje, że dodanie czujników elektromagnetycznych zmniejszyło średni błąd przekroczenia o 60% przy wysokiej prędkości w kontrolowanych testach.
- •Firma stwierdza, że OM-1 może uczyć się zupełnie nowych zadań, w tym o wymagającej dynamice i długim horyzoncie, z mniej niż 30 minut danych, choć podawane liczby pochodzą z własnych testów firmy.

Reward AI zaprezentował OM-1, uniwersalny model fundamentowy dla robotów zaprojektowany do nabywania inteligencji fizycznej bezpośrednio z danych manipulacyjnych ludzi. Zgodnie z oficjalnym ogłoszeniem firmy system może generalizować zero-shot na różnych korpusach robotów — w tym ramionach stołowych, ramionach przemysłowych i humanoidach — bez danych teleoperacyjnych, treningu na robocie czy strojenia dla konkretnego robota. Właśnie w tym ostatnim punkcie tkwi istota sprawy: teleoperacja, w której człowiek steruje robotem w celu nagrywania demonstracji, od dawna jest standardową metodą zbierania danych w badaniach nad manipulacją i wiąże każde nagranie z konkretną maszyną.
Sprzętowym fundamentem systemu jest Omnibody Hand, noszone urządzenie o siedmiu stopniach swobody, oparte na DexCap — wcześniejszych badaniach zespołu na Stanfordzie. Zamiast odwzorowywać ludzką dłoń staw po stawie, urządzenie zostało zaprojektowane wokół możliwości funkcjonalnych: wyboru użytecznych punktów kontaktu, przekręcania obiektów w dłoni oraz płynnego przechodzenia między chwytami precyzyjnymi a silowymi. Ergonomiczne dopasowanie uwzględnia różnice w rozmiarze dłoni i proporcjach palców, dzięki czemu nagrywane ruchy odzwierciedlają naturalne, nieskompensowane ludzkie zachowanie.
Na tym sprzęcie osadzona jest warstwa „One Data Interface”, która łączy wysokoczęstotliwościowe sprzężenie dotykowe, czujniki zbliżeniowe, kamery global-shutter umieszczone w dłoni oraz elektromagnetyczne śledzenie pozycji dłoni, aby rejestrować demonstracje w pełnymzkim tempie. Reward AI informuje, że uzupełnienie śledzenia wizualno-inercyjnego o czujniki elektromagnetyczne zmniejszyło średni błąd przekroczenia o 60% przy wysokiej prędkości w kontrolowanych testach. Wzdłuż trajektorii rejestrowane są również dane siłowe, dzięki czemu demonstracje zawierają zarówno ścieżkę ruchu, jak i wkładany wysiłek.
Uczenie się od ludzi, nie od robotów
OM-1 jest trenowany wyłącznie na danych ludzkich. Zdaniem Reward AI ani teleoperacja, ani jakiekolwiek doświadczenie na robocie nie są wykorzystywane podczas treningu; zamiast tego strategia uczy się generować akcje robota bezpośrednio z ludzkiego ruchu, destylując to, co zespół określa jako podświadomą inteligencję fizyczną, w jeden, zunifikowany model. Ponieważ wszystkie demonstracje docierają przez ten sam interfejs danych, pre-training i post-training są połączone w jeden etap — nowe dane nie wymagają ponownego zbierania ani osobnego potoku treningowego dla każdego robota, zadania czy wdrożenia. Transfer między różnymi korpusami to od dawna cel uczenia robotyki, w którym strategie manipulacji były zazwyczaj trenowane i strojone dla jednej platformy naraz.
Pod względem architektury OM-1 przetwarza każdą modalność sensoryczną — obrazy, sygnały dotykowe, zbliżenie między palcami oraz trajektorie pozycji dłoni — w jej natywnej częstotliwości próbkowania, zachowując wysokoczęstotliwościowe sygnały kontaktu obok wolniejszego kontekstu wizualnego. Czasowa historia tych strumieni pozwala strategii wnioskować o tym, jak kontakt i postęp zadania ewoluują w czasie. Pod modelem znajduje się warstwa sterowania oparta na uczeniu ze wzmocnieniem, działająca z wysoką częstotliwością, która przekształca akcje w napędy dla dowolnego korpusu, kompensując dynamikę, zakłócenia i opóźnienia systemu, a jednocześnie optymalizując przejścia między kolejnymi predykcjami strategii, aby ruch pozostawał płynny przy wysokiej prędkości.
We wnioskach firma stwierdza, że OM-1 może opanowywać zupełnie nowe zadania — w tym te o wymagającej dynamice i długim horyzoncie — z mniej niż 30 minut danych. Jeśli podejście zostanie potwierdzone, pozycjonuje ono rejestrowanie ludzkich demonstracji, sensorykę, uczenie, inferencję i sterowanie jako jeden zintegrowany stos — który firma przedstawia jako odporny na przyszłość wobec sprzętu robotycznego, który dopiero zostanie zaprojektowany. Zgodnie z tą ostrożnością, podawane liczby — 60% poprawy śledzenia i uczenie zadań w mniej niż 30 minut — pochodzą z własnych doniesień firmy i kontrolowanych testów; wydajność na nieznanych korpusach robotów w rzeczywistych wdrożeniach będzie naturalnym kolejnym testem tej koncepcji jednolitego stosu.
Źródło: Metaverse Post