NoticiasAccionesDyna Robotics presenta DYNA-2, un modelo fundacional para robots entrenado con un millón de horas de video humano

Dyna Robotics presenta DYNA-2, un modelo fundacional para robots entrenado con un millón de horas de video humano

Autor: Cryptopolitan·

Puntos clave

  • DYNA-2 fue entrenado exclusivamente con video humano egocéntrico, lo que Dyna dice que equivale a unos 170 años de experiencia continua.
  • Dyna informa que DYNA-2 mejoró las tasas de éxito en tareas de manufactura de alta precisión del 20% a entre 80% y 90%.
  • El modelo utiliza una arquitectura World-Action que predice el siguiente fotograma de video y la siguiente acción durante el preentrenamiento.
  • Dyna dice que el modelo puede adaptarse a nuevas plataformas robóticas con solo horas de ajuste fino, incluido un ejemplo reportado de 13 minutos para desenroscar una tapa de botella.
  • Dyna ya tiene robots DYNA-1 desplegados en entornos comerciales como hoteles, restaurantes, lavanderías y gimnasios.
Dyna Robotics presenta DYNA-2, un modelo fundacional para robots entrenado con un millón de horas de video humano

Dyna Robotics presentó el lunes DYNA-2, un nuevo modelo fundacional para robots que, según la empresa, fue entrenado con más de un millón de horas de video humano y cero datos de robots. La compañía con sede en EE. UU. cree que este enfoque podría abordar los desafíos de costo y escalabilidad que han limitado la robótica de propósito general, una barrera que ha mantenido a la IA física por detrás de otros ámbitos donde el preentrenamiento con datos a gran escala ya impulsó rápidos avances de capacidad.

El cuello de botella de los datos de entrenamiento en robótica

Un obstáculo persistente para desarrollar robots de propósito general es conseguir suficientes datos de entrenamiento. La mayoría de los robots hoy aprenden mediante teleoperación, un proceso en el que un operador humano guía manualmente la máquina a través de tareas durante muchas horas. Este método es lento, costoso y difícil de escalar, lo que en última instancia limita qué tan capaces pueden llegar a ser estos sistemas. El problema es ampliamente reconocido en toda la industria, y actores como Google DeepMind, Tesla y Physical Intelligence están invirtiendo fuertemente en estrategias alternativas de datos para sus propios modelos fundacionales para robots.

DYNA-2 toma un camino distinto al eliminar por completo los datos de robots de la fase de entrenamiento. En su lugar, el modelo fue entrenado exclusivamente con video humano egocéntrico, es decir, grabaciones hechas desde el punto de vista de una persona mientras interactúa con objetos y su entorno. Según la empresa, este conjunto de datos equivale aproximadamente a 170 años de experiencia continua.

Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, for the first time, we discovered several new scaling laws:

• world-action models exhibit scaling law on human data across four orders of magnitude, from 1000… pic.twitter.com/wZamR0axzS — Dyna Robotics (@DynaRobotics) August 10, 2026

El cofundador Jason Ma explicó la lógica: "Action data is scarce, but video is everywhere." Sostuvo que la intuición física "can be learned directly from human video" en lugar de requerir millones de horas de datos recopilados en un brazo robótico.

En tareas de manufactura de alta precisión, DYNA-2 elevó las tasas de éxito del 20% a entre 80% y 90%. Dyna atribuye esta mejora a la gran escala del preentrenamiento con video. En 15 tareas de referencia, los modelos entrenados con mayores volúmenes de video humano superaron de forma consistente a los entrenados con volúmenes menores. Este hallazgo recuerda a las leyes de escalado que transformaron el procesamiento del lenguaje natural, donde el rendimiento del modelo mejoró de forma predecible a medida que aumentaban los datos de entrenamiento y la capacidad de cómputo, aunque sigue siendo una pregunta abierta si esos principios se trasladan por completo a tareas del mundo físico.

En qué se diferencia la arquitectura de DYNA-2

Dyna se distingue por una arquitectura novedosa. En lugar de depender de un modelo de visión y lenguaje, el enfoque usado por sistemas como RT-2 de Google, DYNA-2 es un World-Action Model basado en generación de video. Durante el preentrenamiento, el modelo predice al mismo tiempo el siguiente fotograma de video y la siguiente acción. Dyna dice que este doble objetivo le da al modelo una comprensión interna de la física del contacto y del razonamiento espacial.

La empresa espera que el conocimiento transferido desde videos humanos se generalice a distintas plataformas robóticas, incluidos brazos estacionarios, prototipos humanoides y manos diestras, aunque ninguno de estos dispositivos se utilizó en el preentrenamiento. Adaptar DYNA-2 a una nueva plataforma, según informa la compañía, requiere solo horas de ajuste fino en lugar de semanas de recopilación de datos nuevos. Por ejemplo, Dyna reporta que solo 13 minutos de datos de ajuste fino permitieron a manos robóticas desenroscar una tapa de botella. Si esta transferencia entre plataformas se mantiene en evaluaciones independientes, podría reducir significativamente la barrera para desplegar robots capaces en diversas configuraciones de hardware.

Despliegue en el mundo real y planes futuros

Dyna ya opera robots en entornos comerciales, un factor que la diferencia de muchos pares en el sector de la robótica. Según reportes, los robots DYNA-1 de la empresa ya están desplegados en hoteles, restaurantes, lavanderías y gimnasios. Esta experiencia operativa le proporciona a Dyna retroalimentación de despliegue de la que carecen muchas empresas de robótica centradas en investigación.

Dyna fue fundada por Lindon Gao, York Yang y Jason Ma, quienes trabajaron anteriormente en DeepMind. La hoja de ruta declarada por la compañía es escalar la misma metodología de entrenamiento a 10 millones de horas de video, y lo presenta como un desafío de recopilación de datos más que de construcción de flota. Mientras el sector observa si el preentrenamiento basado en video puede cumplir su promesa, las preguntas clave incluyen si las mejoras demostradas por DYNA-2 se generalizarán más allá de las tareas de referencia a entornos reales impredecibles, y con qué rapidez los competidores que persiguen arquitecturas alternativas podrán cerrar cualquier brecha.