新闻股票Google DeepMind 发布 Gemini Robotics ER 2:支持实时空间推理与多机器人协作

Google DeepMind 发布 Gemini Robotics ER 2:支持实时空间推理与多机器人协作

作者: Google DeepMind Blog·

要点速览

  • Google DeepMind 新发布的 Gemini Robotics ER 2 作为高级推理大脑运行,将物理执行委托给专门的视觉-语言-动作模型。
  • 该系统集成了 Gemini Live API 以实现亚秒级响应时间,支持流畅且安全的机器人操作。
  • 开发者可通过 Gemini API 和 Google AI Studio 访问该平台,构建交互式物理 AI 代理。
  • 该模型引入了多机器人协作能力,允许不同类型的机器通过共享语义理解进行通信。
  • Google 将其视为迄今为止最安全的机器人模型,具备高级空间感知能力,可在人类靠近时安全地暂停机器人运行。
Google DeepMind 发布 Gemini Robotics ER 2:支持实时空间推理与多机器人协作

Google DeepMind 发布 Gemini Robotics ER 2:支持实时空间推理与多机器人协作

Google DeepMind 发布了 Gemini Robotics ER 2,这是该公司最强大的"具身推理"模型,旨在充当机器人的高级大脑。该模型支持实时空间推理、多步骤任务规划以及不同机器人之间的协作,相比前代产品 Gemini Robotics ER 1.6 实现了重大升级。此次发布加剧了通用机器人基础模型新兴市场的竞争,在该领域中,包括 NVIDIA 的 Project GR00T、Figure AI、Physical Intelligence 以及 Tesla 的 Optimus 项目在内的多家厂商,都在竞相构建能够控制物理机器执行多样化任务的 AI 系统。

Gemini Robotics ER 2 现已通过 Gemini API、Google AI Studio 面向开发者公开发布,并在 Gemini Enterprise Agent Platform 上提供私有预览。开发者可以利用它构建能够与人类对话、理解物理世界并规划多步骤任务的物理 AI 代理,然后将运动执行交由底层的视觉-语言-动作(VLA)模型完成。这种分层架构——由推理模型编排高层决策,并将物理控制委托给专门的执行模型——体现了多个机器人 AI 项目共同遵循的设计理念,作为单一端到端模型(试图在同一个系统中处理从感知到运动控制的所有环节)的替代方案。

该模型可以原生调用 Google 搜索等工具或任何用户自定义函数。其架构允许机器人在执行当前动作的同时"思考"下一步,从而实现更流畅的操作。

推进物理代理能力

物理世界中的大多数任务都需要多个步骤才能完成。Gemini Robotics ER 2 作为物理代理,负责为机器人编排步骤、实现自我纠错,并泛化到更多新颖的场景中。开发者可以将底层控制接口——包括 VLA 模型或导航 API——声明为工具,并将多模态视频、音频或文本直接输入到模型中。

Google 报告称,Gemini Robotics ER 2 在三种控制模式下——真实 VLA、模拟 VLA 和人类远程操作——的工具编排能力均持续优于 ER 1.6。

机器人领域的高层推理在很大程度上取决于执行速度。Gemini Robotics ER 2 集成了 Gemini Live API,使用针对延迟敏感型任务优化的双向流式端点。其成果是流畅的编排:模型指挥动作模型和机器人 API 完成多步骤任务,而不会出现早期系统中常见的令人不适的"停下来思考"的中断。亚秒级响应时间一直是安全闭环机器人控制的前提条件;在基于大型语言模型的系统中实现这一目标,缩小了认知规划与物理反应之间长期以来限制实际部署的差距。

为展示这些能力,Google 使用来自 Boston Dynamics 的 Spot 构建了一个演示。Gemini Robotics ER 2 编排 Spot API——例如导航和机械臂运动——创建了一个能够根据自然语言指令取回物品的交互式机器人。代码可在 GitHub 上获取,同时还附带其他示例。

面向稳健任务完成的时间智能

判断任务何时完全完成仍然是机器人领域最持久的挑战之一。Gemini Robotics ER 2 在视频理解和进度追踪方面引入了突破性改进,使机器人能够验证复杂任务——如拧紧灯泡或系紧垃圾袋——是否在继续下一步之前达到了规格要求。

连续进度分类

进度分类是指机器人实时追踪任务完成情况的能力。在 Google 的评估中,视频流中的每一帧被分配到五个进度等级之一(0–20%、20–40%、40–60%、60–80%、80–100%)。通过量化任务进度,该模型赋予机器人态势感知能力,使其能够即时调整动作或在无需重启整个工作流程的情况下重试失败的步骤。

Gemini Robotics ER 2 在进度分类任务上达到了 57.4% 的准确率,优于上一代模型和竞争的前沿模型。

精确关键时刻识别

关键时刻识别衡量的是模型识别关键事件发生的确切视频帧的能力——例如何时应该停止向杯中倒入咖啡。在关键时刻识别任务中,Gemini Robotics ER 2 达到了 91.3% 的准确率和 0.96 秒的平均绝对距离。据 Google 介绍,这一性能可与大得多的模型类别相媲美,同时以极低的计算成本和四倍的执行速度提供了精确度——这正是安全操控真实世界中物理机器人所需的亚秒级延迟。

多机器人协作

没有单一机器人能够胜任所有任务:轮式探测车在室内表现出色,而人形机器人在不平坦地形上可能更具优势。Gemini Robotics ER 2 引入了多机器人协作功能,允许不同类型的机器通过共享的语义理解进行通信,以完成交接和复杂任务。Google 已展示了 Apptronik 的 Apollo 2 与 Franka F3 Duo 协同工作的能力。这使 Google 与 Amazon 处于同一阵营——后者已在配送中心部署了异构机器人车队,但这些系统依赖集中式的仓库管理协调,而非不同品牌机器人之间的实时语义通信。

改进的空间智能

Gemini Robotics ER 2 在三个基准测试中提升了核心空间推理能力:

  • 成功/失败检测:现在基于原始视频流而非静态快照运行,使模型能够捕捉执行过程中的失败,如溢出、滑落或错位。
  • 通用仪表读取:扩展到圆形表盘和视镜之外,涵盖数字显示器、线性刻度尺、直尺和液体温度计。Google 在 10 种不同类型的仪表上测试了该能力。
  • 增强型空间 VQA:通过 Gemini 在多模态理解方面的进步,改善了视觉问答能力。

该模型在所有核心能力上始终达到最高准确率,包括成功检测(图像/视频)、问答(ERQA)和通用仪表读取。

安全性提升

Google 将 Gemini Robotics ER 2 描述为迄今为止最安全的机器人模型,在安全指令遵循和人类近距离基准测试中取得了显著进步——这些评估测试了模型在推理任务中遵循物理约束的能力以及检测附近人类的空间感知能力。随着工业机器人从传统的围栏式部署向人类与机器人共享工作空间的协作环境转型,这些基准测试具有切实的现实意义。

在测试中,Gemini Robotics ER 2 在有人进入其附近区域时成功使人形机器人停止运行,并仅在区域清空后才自主恢复工作。

Google 还推出了一项新基准测试,用于评估基础模型作为安全 VLA 编排器的能力。该基准测试模型强制执行安全约束、监控环境、评估物理可行性以及寻求人类确认的能力。详细信息可在安全技术报告中查阅。

Gemini Robotics ER 2 在安全指令遵循和人类近距离基准测试中均优于 ER 1.6 和其他前沿模型。

展望未来

Google 表示,计划推动该模型应对更复杂的任务,以加速有用机器人的开发并支持更广泛的机器人社区。开发者可以在 GitHub 上找到配置和提示示例,并查看模型卡片了解更多详情。