Reward AI presenta OM-1, un modelo fundacional de robótica que aprende manipulación directamente de datos humanos
Puntos clave
- •Reward AI presentó OM-1, un modelo fundacional de robótica entrenado exclusivamente con datos de manipulación humana, sin teleoperación ni experiencia en el robot durante el entrenamiento.
- •Se reporta que el modelo generaliza de forma zero-shot entre distintos cuerpos de robots, incluidos brazos de mesa, brazos industriales y humanoides, sin ajuste fino específico por robot.
- •Las demostraciones se capturan con el Omnibody Hand, un dispositivo vestible de siete grados de libertad basado en la investigación previa DexCap del equipo en Stanford y diseñado en torno a capacidades funcionales de agarre en lugar de replicar las articulaciones de la mano.
- •La One Data Interface combina retroalimentación táctil, detección de proximidad, cámaras en la mano con obturador global y seguimiento electromagnético de la pose de la mano, y Reward AI afirma que agregar detección electromagnética redujo el error medio de sobrepaso en 60% a alta velocidad en pruebas controladas.
- •La empresa afirma que OM-1 puede aprender tareas completamente nuevas, incluidas las de dinámicas desafiantes y horizontes largos, con menos de 30 minutos de datos, aunque las cifras reportadas provienen de sus propias pruebas.

Reward AI ha presentado OM-1, un modelo fundacional de robótica de propósito general diseñado para adquirir inteligencia física directamente de datos de manipulación humana. Según el anuncio oficial de la empresa, el sistema puede generalizar de forma zero-shot entre distintos cuerpos de robots —incluidos brazos de mesa, brazos industriales y humanoides— sin datos de teleoperación, entrenamiento en el robot ni ajuste fino específico por robot. Ese último punto concentra gran parte de la relevancia: la teleoperación, en la que una persona controla un robot para registrar demostraciones, ha sido durante mucho tiempo un método estándar de recolección de datos en la investigación de manipulación, y vincula cada grabación a una máquina específica.
La base de hardware del sistema es el Omnibody Hand, un dispositivo vestible con siete grados de libertad construido sobre DexCap, la investigación previa del equipo en Stanford. En lugar de replicar la mano humana articulación por articulación, el dispositivo está diseñado en torno a capacidades funcionales: seleccionar puntos de contacto útiles, reorientar objetos dentro de la palma y transitar con fluidez entre agarres de precisión y de fuerza. Un ajuste ergonómico accommodate las variaciones en el tamaño de la mano y las proporciones de los dedos, lo que garantiza que los movimientos registrados reflejen un comportamiento humano natural y no compensado.
Sobre este hardware se encuentra la capa "One Data Interface", que combina retroalimentación táctil de alta frecuencia, detección de proximidad, cámaras en la mano con obturador global y seguimiento electromagnético de la pose de la mano para capturar demostraciones a pleno ritmo humano. Reward AI reporta que la incorporación de detección electromagnética al seguimiento visual-inercial redujo el error medio de sobrepaso en 60% a alta velocidad en pruebas controladas. Los datos de fuerza también se registran a lo largo de las trayectorias, de modo que las demostraciones codifican tanto la trayectoria del movimiento como el esfuerzo detrás de este.
Aprender de personas, no de robots
OM-1 se entrena exclusivamente con datos humanos. Según Reward AI, no se utiliza teleoperación ni experiencia en el robot durante el entrenamiento; en cambio, la política aprende a generar acciones del robot directamente a partir del movimiento humano, destilando lo que el equipo describe como inteligencia física subconsciente en un solo modelo unificado. Como todas las demostraciones llegan a través de la misma interfaz de datos, el preentrenamiento y el postentrenamiento se fusionan en una etapa: los datos nuevos no requieren recolección adicional ni un flujo de entrenamiento separado por robot, tarea o despliegue. Este tipo de transferencia entre cuerpos ha sido un objetivo de larga data en el aprendizaje robótico, donde las políticas de manipulación típicamente se han entrenado y ajustado para una plataforma a la vez.
En cuanto a la arquitectura, OM-1 procesa cada modalidad sensorial —imágenes, señales táctiles, proximidad entre dedos y trayectorias de la pose de la mano— a su tasa de muestreo nativa, preservando las señales de contacto de alta frecuencia junto con el contexto visual más lento. Un historial temporal de estos flujos permite que la política razone sobre cómo evolucionan el contacto y el progreso de la tarea con el tiempo. Debajo del modelo, una capa de control basada en aprendizaje por refuerzo que opera a alta frecuencia traduce las acciones en actuación para cualquier cuerpo dado, compensando dinámicas, perturbaciones y retrasos del sistema, al mismo tiempo que optimiza las transiciones entre predicciones sucesivas de la política para mantener el movimiento fluido a alta velocidad.
En su conclusión, la empresa afirma que OM-1 puede aprender tareas completamente nuevas —incluidas las que involucran dinámicas desafiantes y horizontes largos— con menos de 30 minutos de datos. Si se valida, el enfoque posiciona la captura de demostraciones humanas, la detección, el aprendizaje, la inferencia y el control como una única pila integrada, que la empresa presenta como preparada para el futuro hardware robótico aún por diseñar. En línea con esa cautela, las cifras reportadas —la mejora de 60% en el seguimiento y el aprendizaje de tareas en menos de 30 minutos— provienen de los propios reportes de la empresa y de pruebas controladas; el rendimiento en cuerpos de robots desconocidos en despliegues reales será la prueba natural de esta propuesta de pila única.
Fuente: Metaverse Post