Google DeepMind 推出 Gemini Robotics ER 2:實現即時空間推理與多機器人協作
重點速覽
- •Google DeepMind 新推出的 Gemini Robotics ER 2 作為高階推理大腦運作,將物理執行委派給專門的視覺-語言-動作模型。
- •該系統整合 Gemini Live API 實現亞秒級回應時間,確保流暢且安全的機器人操作。
- •開發者可透過 Gemini API 和 Google AI Studio 存取該平台,建構互動式物理 AI 代理。
- •該模型引入多機器人協作功能,允許不同的機器透過共享語義理解進行通訊。
- •Google 將此視為其迄今為止最安全的機器人模型,具備先進的空間感知能力,可在人類靠近時安全地停止機器人運作。

Google DeepMind 推出 Gemini Robotics ER 2:實現即時空間推理與多機器人協作
Google DeepMind 已推出 Gemini Robotics ER 2,這是該公司最強大的「具身推理」模型,旨在作為機器人的高階大腦。該模型支援即時空間推理、多步驟任務規劃,以及不同機器人之間的協作,相較於前代產品 Gemini Robotics ER 1.6 有顯著升級。此次發布加劇了通用型機器人基礎模型新興市場的競爭,在該領域中,包括 NVIDIA 的 Project GR00T、Figure AI、Physical Intelligence 以及 Tesla 的 Optimus 專案等參與者,都在競相打造能夠控制物理機器執行多樣化任務的 AI 系統。
Gemini Robotics ER 2 現已透過 Gemini API 和 Google AI Studio 向開發者公開提供,並在 Gemini Enterprise Agent Platform 上進行非公開預覽。開發者可利用它來建構能與人類對話、理解物理世界、規劃多步驟任務的物理 AI 代理,再將馬達執行交由低階視覺-語言-動作(VLA)模型處理。這種分層架構——由推理模型編排高階決策,並將物理控制委派給專門的執行模型——反映了多個機器人 AI 研究計畫共享的設計理念,作為單一端對端模型(試圖在單一系統中處理從感知到馬達控制的所有環節)的替代方案。
該模型可原生呼叫 Google Search 等工具或任何使用者定義的函式。其架構允許機器人在執行當前動作的同時「思考」下一步,從而實現更流暢的操作。
推進物理代理能力
大多數物理世界的任務都需要多個步驟才能完成。Gemini Robotics ER 2 作為一個物理代理,負責編排機器人的操作步驟、實現自我修正,並推廣至全新的情境。開發者可將低階控制介面(包括 VLA 模型或導航 API)宣告為工具,並將多模態視訊、音訊或文字直接串流輸入模型。
Google 報告指出,Gemini Robotics ER 2 在三種控制模式下——真實 VLA、模擬 VLA 和人類遠端操作——的工具編排能力均持續優於 ER 1.6。
機器人領域的高階推理高度依賴執行速度。Gemini Robotics ER 2 整合了 Gemini Live API,使用針對延遲敏感任務最佳化的雙向串流端點。其成果是流暢的編排:模型指揮動作模型和機器人 API 完成多步驟任務,不再出現早期系統中典型的令人不適的「停下來思考」中斷。亞秒級回應時間一直是安全閉環機器人控制的先決條件;在大語言模型系統中實現這一目標,縮小了認知規劃與物理反應之間長期以來限制實際部署的差距。
為了展示這些能力,Google 使用來自 Boston Dynamics 的 Spot 建構了一個展示。Gemini Robotics ER 2 編排 Spot API——如導航和機械臂運動——創造出一個可根據自然語言指令取得物品的互動式機器人。相關程式碼及其他範例可在 GitHub 上取得。
任務完成的時間智慧
判斷任務何時真正完成一直是機器人領域最持久的挑戰之一。Gemini Robotics ER 2 在視訊理解和進度追蹤方面帶來了突破性改進,使機器人能夠在繼續下一步之前驗證複雜任務——例如鎖緊燈泡或綁緊垃圾袋——是否符合規格要求。
持續進度分類
進度分類是指機器人即時追蹤任務完成進度的能力。在 Google 的評估中,視訊串流中的每一幀被歸入五個進度等級之一(0–20%、20–40%、40–60%、60–80%、80–100%)。透過量化任務進度,模型賦予機器人情境感知能力,使其能夠即時調整動作或重試失敗的步驟,而無需重新啟動整個工作流程。
Gemini Robotics ER 2 在進度分類任務中達到 57.4% 的準確率,超越了前代模型和競爭的前沿模型。
精準時刻定位
時刻定位衡量的是模型識別關鍵事件發生的確切視訊幀的能力——例如何時應停止向杯中倒入咖啡。在時刻定位任務中,Gemini Robotics ER 2 達到 91.3% 的準確率,平均絕對距離為 0.96 秒。根據 Google 的說法,此效能與大得多的模型類別競爭激烈,但僅需一小部分的運算成本和四倍的執行速度即可提供精確度——這是在真實環境中安全操作物理機器人所需的亞秒級延遲。
多機器人協作
沒有單一機器人適合所有任務:輪式探測器在室內表現出色,而人形機器人在不平坦地形上可能表現更佳。Gemini Robotics ER 2 引入了多機器人協作功能,允許不同的機器透過共享的語義理解進行通訊,從而交接並完成複雜任務。Google 已展示了 Apptronik 的 Apollo 2 與 Franka F3 Duo 協同工作的能力。這使得 Google 與 Amazon 站在同一陣線——後者已在物流中心部署了異構機器人車隊,不過那些系統依賴集中式的倉庫管理協調,而非不同品牌機器人之間的即時語義通訊。
改善空間智慧
Gemini Robotics ER 2 在三項基準測試中推進了核心空間推理能力:
- 成功/失敗偵測:現已針對原始視訊串流運作,而非靜態快照,使模型能夠捕捉執行過程中的失誤,如溢出、滑動或對位偏差。
- 通用儀器讀取:擴展至圓形錶盤和觀測窗之外,涵蓋數位顯示器、線性刻度尺、直尺和液體溫度計。Google 在 10 種不同類型的儀器上測試了此功能。
- 增強空間 VQA:透過 Gemini 在多模態理解方面的進展,改善了視覺問答能力。
該模型在所有核心能力上均持續達到最高準確率,包括成功偵測(圖像/視訊)、問答(ERQA)和通用儀器讀取。
安全性進展
Google 將 Gemini Robotics ER 2 描述為其迄今為止最安全的機器人模型,在安全指令遵循和人體鄰近基準測試上取得顯著進展——這些評估測試模型在推理任務中遵守物理約束的程度,以及其偵測附近人類的空間感知能力。隨著工業機器人從傳統的圍籬式部署轉向人類與機器人共享工作空間的協作環境,這些基準測試具有實際重要性。
在測試中,Gemini Robotics ER 2 在有人進入其周圍區域時成功使人形機器人停止運作,並僅在區域清空後才自主恢復工作。
Google 還推出了一項新的基準測試,用於評估基礎模型作為安全 VLA 編排器的能力。該基準測試評估模型執行安全約束、監控環境、評估物理可行性和尋求人類澄清的能力。完整詳情請參閱安全技術報告。
Gemini Robotics ER 2 在安全指令遵循和人體鄰近基準測試上均優於 ER 1.6 及其他前沿模型。
展望未來
Google 表示計畫將該模型推向更複雜的任務,以加速實用機器人的開發並支援更廣泛的機器人社群。開發者可在 GitHub 上找到設定和提示範例,並查閱模型卡了解更多詳情。