新聞宏觀經濟Reward AI 推出 OM-1:直接從人類數據學習操作技能的機器人基礎模型

Reward AI 推出 OM-1:直接從人類數據學習操作技能的機器人基礎模型

作者: Metaverse Post·

重點速覽

  • Reward AI 推出 OM-1,一款完全以人類操作數據訓練的機器人基礎模型,訓練過程未使用遙操作或機器人上的實際經驗。
  • 據報導,此模型可在不同機器人本體之間實現零樣本泛化,包括桌上型機械臂、工業機械臂和人形機器人,無需針對特定機器人微調。
  • 示範數據透過 Omnibody Hand 擷取,這是一款七自由度穿戴裝置,建構於該團隊先前在史丹佛的 DexCap 研究之上,並圍繞功能性抓取能力而非複製手部關節設計。
  • One Data Interface 結合觸覺回饋、接近感測、全域快門掌內攝影機與電磁手部姿態追蹤,Reward AI 表示加入電磁感測後,在受控高速測試中將平均過衝誤差降低了60%。
  • 該公司表示 OM-1 能從不到30分鐘的數據中學習全新任務,包括涉及挑戰性動力學與長時間跨度的任務,惟所報告的數據均來自其自身測試。
Reward AI 推出 OM-1:直接從人類數據學習操作技能的機器人基礎模型

Reward AI 推出 OM-1,這是一款通用機器人基礎模型,旨在直接從人類操作數據中獲取物理智能。根據該公司的官方公告,此系統可在不同機器人本體之間實現零樣本泛化——包括桌上型機械臂、工業機械臂和人形機器人——而無需遙操作數據、機器人上訓練或針對特定機器人的微調。最後這一點正是其重要意義所在:遙操作(由人類操控機器人以錄製示範)長期以來一直是操作研究中的標準數據收集方法,但它將每段錄製內容綁定於特定機器。

該系統的硬體基礎是 Omnibody Hand,一款具有七個自由度的穿戴裝置,建構於該團隊先前在史丹佛大學的研究成果 DexCap 之上。此裝置並非逐一複製人類手部關節,而是圍繞功能性能力設計:選擇有效的接觸點、在手掌內重新定向物體,以及在精密抓取與力量抓取之間流暢切換。符合人體工學的貼合設計可適應手部大小與手指比例的差異,確保錄製的動作反映自然、未經補償的人類行為。

在此硬體之上是「One Data Interface」層,結合高頻觸覺回饋、接近感測、全域快門掌內攝影機以及電磁手部姿態追蹤,以完整的人類速度擷取示範。Reward AI 表示,在受控測試中,以電磁感測強化視覺慣性追蹤,將高速下的平均過衝誤差降低了60%。力數據也會沿軌跡記錄,因此示範編碼了動作路徑及其背後的施力。

向人類學習,而非機器人

OM-1 完全以人類數據訓練。據 Reward AI 表示,訓練過程中既未使用遙操作,也未使用任何機器人上的實際經驗;此策略改為直接從人類動作生成機器人動作,將該團隊描述的「潛意識物理智能」提煉為單一統一模型。由於所有示範皆透過相同的數據介面輸入,預訓練與後訓練合併為單一階段——新數據無需重新收集,也無需針對每個機器人、任務或部署建立獨立的訓練流程。此類跨本體遷移一直是機器人學習領域的長期目標,過去操作策略通常需要針對單一平台逐一訓練與調校。

在架構上,OM-1 以各感官模態的原生取樣率處理圖像、觸覺訊號、手指間接近感測與手部姿態軌跡,在較慢的視覺情境之外保留高頻接觸線索。這些數據流的時間歷史使策略能夠推理接觸與任務進度如何隨時間演變。在模型之下,一個以高頻運行的強化學習控制層將動作轉換為任何給定本體的致動指令,補償動力學、干擾與系統延遲,同時最佳化相鄰策略預測之間的轉換,以保持高速下的運動平滑。

該公司在結論中表示,OM-1 能從不到30分鐘的數據中學習全新任務——包括涉及挑戰性動力學與長時間跨度的任務。若獲得驗證,此方法將人類示範擷取、感測、學習、推理與控制定位為單一整合堆疊——該公司將其形容為對尚未設計出的機器人硬體也具備未來適應性。與此保留態度一致,所報告的數據——60%的追蹤改善與30分鐘內的任務學習——均來自該公司自身的報告與受控測試;在真實部署中於陌生機器人本體上的表現,將是檢驗單一堆疊架構的下一步自然課題。

來源:Metaverse Post