Reward AI представила OM-1 — фундаментальную модель робота, обучающуюся манипуляциям напрямую на данных человека
Ключевые выводы
- •Reward AI представила OM-1 — фундаментальную модель робота, обучающуюся исключительно на данных о манипуляциях человека; телеперация и опыт на борту робота при обучении не используются.
- •По имеющимся данным, модель обобщает zero-shot на разные типы роботов, включая настольные манипуляторы, промышленные руки и гуманоидов, без тонкой настройки под конкретного робота.
- •Демонстрации записываются с помощью Omnibody Hand — носимого устройства с семью степенями свободы, созданного на основе предыдущей исследовательской работы команды в Стэнфорде DexCap и спроектированного вокруг функциональных возможностей захвата, а не воспроизведения суставов кисти.
- •One Data Interface объединяет тактильную обратную связь, датчики приближения, камеры с глобальным затвором в кисти и электромагнитное отслеживание позы руки; по данным Reward AI, добавление электромагнитных датчиков сократило среднюю ошибку перелёта на 60% на высокой скорости в контролируемых тестах.
- •Компания заявляет, что OM-1 может осваивать совершенно новые задачи, включая сложную динамику и длинные горизонты планирования, менее чем за 30 минут данных, хотя приведённые показатели получены из её собственных тестов.

Reward AI представила OM-1 — универсальную фундаментальную модель робота, созданную для приобретения физического интеллекта напрямую на данных о манипуляциях человека. Согласно официальному объявлению компании, система способна обобщать zero-shot на разные типы роботов — включая настольные манипуляторы, промышленные руки и гуманоидов — без данных телеперации, обучения на борту робота и тонкой настройки под конкретного робота. Именно последний пункт имеет ключевое значение: телеперация, при которой человек управляет роботом для записи демонстраций, давно является стандартным методом сбора данных в исследованиях манипуляций, и она привязывает каждую запись к конкретной машине.
Аппаратной основой системы является Omnibody Hand — носимое устройство с семью степенями свободы, созданное на базе DexCap, предыдущей исследовательской работы команды в Стэнфорде. Вместо того чтобы воспроизводить кисть человека сустав за суставом, устройство спроектировано вокруг функциональных возможностей: выбора полезных точек контакта, переориентации объектов в ладони и плавного перехода между точным и силовым захватом. Эргономичная посадка учитывает различия в размере кисти и пропорциях пальцев, благодаря чему записанные движения отражают естественное, некомпенсированное поведение человека.
Поверх этого аппаратного обеспечения располагается слой «One Data Interface», объединяющий высокочастотную тактильную обратную связь, датчики приближения, камеры с глобальным затвором в кисти и электромагнитное отслеживание позы руки для записи демонстраций в полном человеческом темпе. Reward AI сообщает, что дополнение визуально-инерциального отслеживания электромагнитными датчиками сократило среднюю ошибку перелёта на 60% на высокой скорости в контролируемых тестах. Данные о силе также записываются вдоль траекторий, поэтому демонстрации кодируют как путь движения, так и усилие, стоящее за ним.
Обучение на людях, а не на роботах
OM-1 обучается исключительно на данных человека. По данным Reward AI, ни телеперация, ни какой-либо опыт на борту робота при обучении не используются; политика вместо этого учится генерировать действия робота напрямую на основе движений человека, дистиллируя то, что команда называет подсознательным физическим интеллектом, в единую модель. Поскольку все демонстрацииают через один и тот же интерфейс данных, предобучение и постобучение объединены в один этап — новые данные не требуют повторного сбора и отдельного конвейера обучения для каждого робота, задачи или развёртывания. Такой межтелесный перенос давно является целью обучения роботов, где политики манипуляций, как правило, обучались и настраивались под одну платформу за раз.
С точки зрения архитектуры OM-1 обрабатывает каждую сенсорную модальность — изображения, тактильные сигналы, приближение пальцев друг к другу и траектории позы кисти — на её исходной частоте дискретизации, сохраняя высокочастотные сигналы контакта наряду с более медленным визуальным контекстом. Временная история этих потоков позволяет политике рассуждать о том, как контакт и прогресс задачи развиваются во времени. Под моделью работает работающий на высокой частоте слой управления на основе обучения с подкреплением, который преобразует действия в приводы для любого заданного корпуса, компенсируя динамику, возмущения и системные задержки и оптимизируя переходы между последовательными предсказаниями политики, чтобы движение оставалось плавным на скорости.
В заключение компания заявляет, что OM-1 способна осваивать совершенно новые задачи — включая те, что сопряжены со сложной динамикой и длинными горизонтами планирования, — менее чем за 30 минут данных. Если подход подтвердится, он объединит захват демонстраций человека, сенсорику, обучение, вывод и управление в единый интегрированный стек — который компания описывает как защищённый от устаревания для аппаратного обеспечения роботов, которое ещё только предстоит разработать. В соответствии с этой оговоркой приведённые показатели — 60-процентное улучшение отслеживания и освоение задач менее чем за 30 минут — получены из собственных отчётов компании и контролируемых тестов; производительность на незнакомых типах роботов в реальных внедрениях станет естественным следующим испытанием концепции единого стека.
Источник: Metaverse Post