Google DeepMind 發布 Gemini Robotics 2 人形機器人模型
重點速覽
- •Google DeepMind 推出了 Gemini Robotics 2,這是一款視覺-語言-動作模型,使人形機器人能夠執行通常由人類完成的物理任務。
- •該系統結合多個 AI 模型實現全身控制,使機器人能夠感知周圍環境、推理多步驟任務、協調動作,同時與其他機器人協作。
- •示範影片顯示,Apptronik 的 Apollo 2 機器人和 Sharpa 機器手自主完成繫垃圾袋和安裝燈泡等任務,訓練方式結合了遠端操作、影片示範和模擬。
- •Forrester 分析師 Paul Miller 警告,彌合機器人大腦與身體之間的差距伴隨重大安全風險,在與人類並肩廣泛部署之前,必須證明具備健全的安全保障。
- •Miller 預期物理 AI 近期主要在工廠和倉庫等受控環境中創造價值,這些環境的布局更緊湊、任務比家庭環境更可預測。

Google DeepMind 已發布 Gemini Robotics 2,這是其視覺-語言-動作模型的最新版本,搭載於人形機器人中。
該公司在部落格文章中表示,此次發布是朝向「物理 AGI」邁出的重要一步——即能夠透過機器人等物理系統與真實世界互動並在其中運作的人工通用智慧,使機器人能夠執行人類所能完成的物理任務。
透過結合多個 AI 模型,該系統實現了 DeepMind 所稱的「智能全身控制」。該公司表示,這賦予了機器人感知周圍環境、推理多步驟任務以及協調全身運動的能力。整合該系統的機器人還能與其他機器人協作,凸顯了機器人系統正日益圍繞協作而非單一任務自動化來構建。
DeepMind 機器人業務負責人 Carolina Parada 將這項技術的長期目標描述為實現「機器人能夠執行人類所能完成的任何任務」。
上週發布的示範影片顯示,Apptronik 的 Apollo 2 機器人和 Sharpa 的機器手自主完成了繫垃圾袋和安裝燈泡等家庭和工業任務。這些系統透過遠端操作、影片示範和模擬相結合的方式進行訓練。
Forrester 分析師 Paul Miller 表示,此次發布建立在 Google 先前的機器人研究基礎之上,改善了機器人之間的協作,幫助機器從失敗的動作中恢復,並讓模型對整個機器人有更好的理解,而不僅僅關注手臂或夾爪等單個組件。
儘管如此,Miller 表示,彌合機器人大腦與身體之間差距的這一飛躍伴隨著重大風險。
「機器人是物理實體,」他表示。「它們可能很強壯,也可能很笨重。與這些機器一起工作的人,以及在世界中遇到它們的人,都需要確信這些機器是安全的。」
他指出了多項挑戰,包括確保機器人在感測器或電力系統故障時能夠安全地停止運作,並認為與人類並肩的廣泛部署將取決於健全的安全保障措施。
「在機器人真正能夠與人類並肩部署之前,安全案例必須被令人信服且可信地證明,」他表示。
關於 Google 實現物理 AGI 的目標,Miller 表示目前這一承諾仍只是「願景」。
「一台最終能在任何環境中做人類能做的任何事的機器人,可能是一個合理的研究目標,但我們距離這個目標還很遙遠,」他表示。
目前,他預期物理 AI 將在工廠和倉庫等受控環境中創造價值,因為更緊湊的布局和更可預測的任務使得限制風險和不確定性更加容易。
「物理 AI 可能比先前的自動化形式更具適應性和靈活性,但在能夠最小化風險、最小化不確定性並最大化利用率的環境中部署自動化,仍然更加容易且成本更低,」他表示。「工廠或倉庫可能嘈雜、骯髒或混亂,但對機器人來說,這比家庭環境簡單得多。」