Reward AI presenta OM-1, un modello fondamentale per la robotica che apprende la manipolazione direttamente dai dati umani
Punti chiave
- •Reward AI ha presentato OM-1, un modello fondamentale per la robotica addestrato esclusivamente su dati di manipolazione umani, senza uso di teleoperazione o esperienza sul robot durante l'addestramento.
- •Il modello, secondo quanto riferito, generalizza zero-shot su corpi robotici diversi, tra cui bracci da tavolo, bracci industriali e umanoidi, senza fine-tuning specifico per robot.
- •Le dimostrazioni vengono acquisite con l'Omnibody Hand, un dispositivo indossabile con sette gradi di libertà basato sulla precedente ricerca DexCap del team a Stanford e progettato attorno a capacità di presa funzionali anziché alla replicazione dei giunti della mano.
- •Il One Data Interface combina feedback tattile, rilevamento di prossimità, telecamere global-shutter integrate nella mano e tracciamento elettromagnetico della posa della mano; Reward AI afferma che l'aggiunta rilevamento elettromagnetico ha ridotto l'errore medio di overshoot del 60% ad alta velocità in test controllati.
- •L'azienda dichiara che OM-1 può apprendere compiti completamente nuovi, inclusi quelli con dinamiche impegnative e orizzonti lunghi, con meno di 30 minuti di dati, sebbene i dati riportati provengano dai suoi stessi test.

Reward AI ha presentato OM-1, un modello fondamentale per la robotica di uso generale progettato per acquisire intelligenza fisica direttamente dai dati di manipolazione umani. Secondo l'annuncio ufficiale dell'azienda, il sistema può generalizzare zero-shot su corpi robotici diversi — tra cui bracci da tavolo, bracci industriali e umanoidi — senza dati di teleoperazione, addestramento sul robot o fine-tuning specifico per robot. È proprio quest'ultimo punto a racchiudere gran parte dell'importanza del risultato: la teleoperazione, in cui un umano guida un robot per registrare dimostrazioni, è da tempo un metodo standard di raccolta dati nella ricerca sulla manipolazione, e lega ogni registrazione a una macchina specifica.
La base hardware del sistema è l'Omnibody Hand, un dispositivo indossabile con sette gradi di libertà costruito su DexCap, la precedente ricerca del team a Stanford. Piuttosto che replicare la mano umana giunto per giunto, il dispositivo è progettato attorno a capacità funzionali: selezione di punti di contatto utili, riorientamento degli oggetti nel palmo e transizione fluida tra prese di precisione e prese di potenza. Una vestibilità ergonomica si adatta alle variazioni di dimensione della mano e proporzione delle dita, garantendo che i movimenti registrati riflettano un comportamento umano naturale e non compensato.
Sopra questo hardware si colloca il livello "One Data Interface", che combina feedback tattile ad alta frequenza, rilevamento di prossimità, telecamere global-shutter integrate nella mano e tracciamento elettromagnetico della posa della mano per acquisire dimostrazioni al pieno ritmo umano. Reward AI riferisce che l'aggiunta del rilevamento elettromagnetico al tracciamento visual-inerziale ha ridotto l'errore medio di overshoot del 60% ad alta velocità in test controllati. I dati di forza vengono inoltre registrati lungo le traiettorie, così che le dimostrazioni codifichino sia il percorso di un movimento sia lo sforzo alla base.
Imparare dalle Persone, Non dai Robot
OM-1 è addestrato esclusivamente su dati umani. Secondo Reward AI, durante l'addestramento non viene utilizzata né la teleoperazione né alcuna esperienza sul robot; la policy apprende invece a generare azioni robotiche direttamente dal movimento umano, distill ciò che il team descrive come intelligenza fisica inconscia in un unico modello unificato. Poiché tutte le dimostrazioni arrivano attraverso la stessa interfaccia dati, pre-addestramento e post-addestramento sono fusi in un'unica fase — i nuovi dati non richiedono alcuna ricollecta né pipeline di addestramento separate per robot, compito o deployment. Il trasferimento cross-embodiment di questo tipo è stato da lungo tempo un obiettivo dell'apprendimento robotico, dove le policy di manipolazione sono state tipicamente addestrate e regolate per una piattaforma alla volta.
Dal punto di vista architetturale, OM-1 elabora ciascuna modalità sensoriale — immagini, segnali tattili, prossimità inter-dita e traiettorie della posa della mano — alla sua frequenza di campionamento nativa, preservando i segnali di contatto ad alta frequenza accanto al contesto visivo più lento. Una storia temporale di questi flussi consente alla policy di ragionare su come evolvono il contatto e l'avanzamento del compito nel tempo. Sotto il modello, un livello di controllo basato su apprendimento per rinforzo in esecuzione ad alta frequenza traduce le azioni in attuazione per qualsiasi corpo, compensando dinamiche, disturbi e ritardi di sistema, ottimizzando al contempo le transizioni tra previsioni successive della policy per mantenere il movimento fluido in velocità.
Nelle sue conclusioni, l'azienda dichiara che OM-1 può apprendere compiti completamente nuovi — inclusi quelli con dinamiche impegnative e orizzonti lunghi — con meno di 30 minuti di dati. Se convalidato, l'approccio posizione l'acquisizione di dimostrazioni umane, il rilevamento, l'apprendimento, l'inferenza e il controllo come un unico stack integrato — una soluzione che l'azienda presenta come a prova di futuro per hardware robotico che deve ancora essere progettato. In coerenza con questa cautela, i dati riportati — il miglioramento del 60% nel tracciamento e l'apprendimento di compiti in meno di 30 minuti — provengono dalle stesse dichiarazioni dell'azienda e da test controllati; le prestazioni su corpi robotici sconosciuti in deployment reali sono il naturale prossimo test di questa visione a stack unico.
Fonte: Metaverse Post