НовостиАкцииDyna Robotics представляет DYNA-2 — базовую модель для роботов, обученную на одном миллионе часов видео с участием людей

Dyna Robotics представляет DYNA-2 — базовую модель для роботов, обученную на одном миллионе часов видео с участием людей

Автор: Cryptopolitan·

Ключевые выводы

  • DYNA-2 была обучена исключительно на эгоцентрическом видео с участием людей, что, по словам Dyna, эквивалентно примерно 170 годам непрерывного опыта.
  • Dyna сообщает, что DYNA-2 повысила уровень успешности на задачах высокоточного производства с 20% до 80–90%.
  • Модель использует архитектуру World-Action, которая во время предварительного обучения предсказывает следующий кадр видео и следующее действие.
  • Dyna заявляет, что модель можно адаптировать к новым роботизированным платформам всего за несколько часов точной настройки, включая пример с 13-минутной настройкой для откручивания крышки бутылки.
  • Dyna уже развёртывает свои предыдущие роботы DYNA-1 в коммерческих условиях — отелях, ресторанах, прачечных и фитнес-залах.
Dyna Robotics представляет DYNA-2 — базовую модель для роботов, обученную на одном миллионе часов видео с участием людей

Dyna Robotics в понедельник представила DYNA-2 — новую базовую модель для роботов, которая, по словам компании, была обучена на более чем одном миллионе часов видео с участием людей и нулевом объёме данных от роботов. Американская компания полагает, что этот подход может решить проблемы стоимости и масштабируемости, сдерживающие развитие универсальной робототехники — препятствие, из-за которого физический ИИ отстаёт от других областей, где крупномасштабное предварительное обучение на данных уже обеспечило стремительный рост возможностей.

Узкое место обучающих данных в робототехнике

Постоянным препятствием в разработке универсальных роботов является получение достаточного объёма обучающих данных. Большинство современных роботов обучаются методом телетрансляции — процессом, при котором оператор-человек вручную направляет машину при выполнении задач на протяжении многих часов. Этот метод медленный, дорогостоящий и трудно масштабируемый, что в конечном итоге ограничивает потенциал таких систем. Эта проблема широко признаётся в отрасли: такие игроки, как Google DeepMind, Tesla и Physical Intelligence, активно инвестируют в альтернативные стратегии работы с данными для собственных базовых моделей роботов.

DYNA-2 идёт другим путём, полностью исключая данные от роботов из этапа обучения. Вместо этого модель была обучена исключительно на эгоцентрическом видео с участием людей — материалах, записанных от первого лица человека при взаимодействии с объектами и окружающей средой. По данным компании, этот набор данных эквивалентен приблизительно 170 годам непрерывного опыта.

Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, for the first time, we discovered several new scaling laws:

• world-action models exhibit scaling law on human data across four orders of magnitude, from 1000… pic.twitter.com/wZamR0axzS — Dyna Robotics (@DynaRobotics) August 10, 2026

Сооснователь Jason Ma пояснил логику: «Данные о действиях — дефицитный ресурс, но видео повсюду». Он утверждал, что физическая интуиция «может быть получена непосредственно из видео с участием людей», а не требовать миллионов часов данных, собранных на манипуляторе.

На задачах высокоточного производства уровень успешности вырос с 20% до 80–90%. Dyna связывает это улучшение с масштабом предварительного видеообучения. В 15 тестовых задачах модели, обученные на большем объёме видео с участием людей, стабильно превосходили модели, обученные на меньшем объёме. Этот результат перекликается с законами масштабирования, которые преобразовали обработку естественного языка, где производительность моделей предсказуемо улучшалась с увеличением объёма обучающих данных и вычислительных ресурсов — хотя вопрос о том, насколько полно эти принципы применимы к задачам физического мира, остаётся открытым.

Чем архитектура DYNA-2 отличается от других

Dyna выделяется благодаря новаторской архитектуре. Вместо модели «зрение-язык» — подхода, применяемого в таких системах, как Google RT-2, — DYNA-2 представляет собой World-Action Model на основе генерации видео. Во время предварительного обучения модель одновременно предсказывает как следующий кадр видео, так и следующее действие. Dyna утверждает, что эта двойная задача даёт модели внутреннее понимание контактной физики и пространственного мышления.

Компания ожидает, что знания, полученные из видео с участием людей, будут переноситься на различные роботизированные платформы — включая стационарные манипуляторы, прототипы гуманоидных роботов и многопалые кисти — даже несмотря на то, что ни одно из этих устройств не использовалось при предварительном обучении. По имеющимся данным, адаптация DYNA-2 к новой платформе требует всего нескольких часов точной настройки вместо недель сбора новых данных. Например, Dyna сообщает, что всего 13 минут данных для точной настройки позволили роботизированным кистям открутить крышку бутылки. Если такая кросс-платформенная передача навыков подтвердится при независимом тестировании, это может значительно снизить барьер для развёртывания функциональных роботов на разнообразном аппаратном обеспечении.

Реальное развёртывание и будущие планы

Dyna уже использует роботов в коммерческих условиях, что отличает её от многих конкурентов в области робототехники. По имеющимся данным, роботы DYNA-1 в настоящее время развёрнуты в отелях, ресторанах, прачечных и фитнес-залах. Этот эксплуатационный опыт обеспечивает Dyna обратной связью от реальных развёртываний, которой лишены многие исследовательские робототехнические компании.

Dyna была основана Lindon Gao, York Yang и Jason Ma, ранее работавшими в DeepMind. Заявленная дорожная карта компании — масштабировать ту же методологию обучения до 10 миллионов часов видео, что сама компания характеризует как задачу сбора данных, а не строительства флота роботов. Пока отрасль наблюдает, сможет ли предварительное обучение на видео оправдать возложенные надежды, ключевыми вопросами остаются: будут ли продемонстрированные достижения DYNA-2 распространяться за пределы тестовых задач на непредсказуемые условия реального мира, и как быстро конкуренты с альтернативными архитектурами смогут ликвидировать отставание.