Google DeepMind lanza Gemini Robotics ER 2 para razonamiento espacial en tiempo real y colaboración entre múltiples robots
Puntos clave
- •El recién lanzado Gemini Robotics ER 2 de Google DeepMind funciona como un cerebro de razonamiento de alto nivel que delega la ejecución física a modelos especializados de visión-lenguaje-acción.
- •El sistema se integra con la Gemini Live API para lograr tiempos de respuesta inferiores a un segundo, permitiendo operaciones robóticas fluidas y seguras.
- •Los desarrolladores pueden acceder a la plataforma a través de la Gemini API y Google AI Studio para construir agentes de IA física interactivos.
- •El modelo introduce capacidades de colaboración entre múltiples robots, permitiendo que máquinas diversas se comuniquen mediante una comprensión semántica compartida.
- •Google considera este su modelo de robótica más seguro hasta la fecha, con conciencia espacial avanzada que detiene de forma segura los robots cuando hay personas cerca.

Google DeepMind lanza Gemini Robotics ER 2 para razonamiento espacial en tiempo real y colaboración entre múltiples robots
Google DeepMind ha lanzado Gemini Robotics ER 2, el modelo de "razonamiento corpóreo" más capaz de la empresa, diseñado para funcionar como un cerebro de alto nivel para robots. El modelo permite razonamiento espacial en tiempo real, planificación de tareas de múltiples pasos y colaboración entre diferentes robots, representando una mejora significativa respecto a su predecesor, Gemini Robotics ER 1.6. El lanzamiento intensifica la competencia en el mercado emergente de modelos fundacionales de robótica de propósito general, donde actores como NVIDIA con Project GR00T, Figure AI, Physical Intelligence y el programa Optimus de Tesla compiten por construir sistemas de IA que puedan controlar máquinas físicas en diversas tareas.
Gemini Robotics ER 2 ya está disponible públicamente para desarrolladores a través de la Gemini API, Google AI Studio, y en vista previa privada en la Gemini Enterprise Agent Platform. Los desarrolladores pueden utilizarlo para construir agentes de IA física que conversen con humanos, comprendan el mundo físico y planifiquen tareas de múltiples pasos antes de delegar la ejecución motora a modelos de visión-lenguaje-acción (VLA) de nivel inferior. Esta arquitectura por capas — donde un modelo de razonamiento orquesta decisiones de alto nivel y delega el control físico a modelos de ejecución especializados — refleja una filosofía de diseño compartida por varios esfuerzos de IA en robótica, como alternativa a los modelos de un solo extremo a extremo que intentan gestionar todo, desde la percepción hasta el control motor, en un único sistema.
El modelo puede invocar de forma nativa herramientas como Google Search o cualquier función definida por el usuario. Su arquitectura permite que un robot "piense" en el siguiente paso mientras ejecuta simultáneamente las acciones actuales, posibilitando un funcionamiento más fluido.
Avances en las capacidades agentivas físicas
La mayoría de las tareas del mundo físico requieren múltiples pasos. Gemini Robotics ER 2 funciona como un agente físico que orquesta pasos, permite la autocorrección y generaliza a situaciones novedosas. Los desarrolladores pueden declarar interfaces de control de bajo nivel — incluidos modelos VLA o API de navegación — como herramientas y transmitir video, audio o texto multimodal directamente al modelo.
Google informa que Gemini Robotics ER 2 supera de manera consistente a ER 1.6 en orquestación de herramientas en tres modos de control: VLA real, VLA simulado y teleoperación humana.
El razonamiento de alto nivel en robótica depende en gran medida de la velocidad de ejecución. Gemini Robotics ER 2 se integra con la Gemini Live API, utilizando un endpoint de streaming bidireccional optimizado para tareas sensibles a la latencia. El resultado es una orquestación fluida en la que el modelo comanda modelos de acción y API de robótica para completar tareas de múltiples pasos sin las interrupciones disruptivas de "detenerse y pensar" típicas de sistemas anteriores. Los tiempos de respuesta inferiores a un segundo han sido durante mucho tiempo un requisito previo para el control seguro de robots en lazo cerrado; lograrlos en un sistema basado en modelos de lenguaje a gran escala reduce la brecha entre la planificación cognitiva y la reacción física que históricamente ha limitado el despliegue en el mundo real.
Para demostrar estas capacidades, Google construyó una demostración utilizando a Spot de Boston Dynamics. Gemini Robotics ER 2 orquesta las API de Spot — como navegación y movimiento del manipulador — para crear un robot interactivo que recoge objetos por comando de lenguaje natural. El código está disponible en GitHub junto con otros ejemplos.
Inteligencia temporal para la finalización de tareas
Determinar cuándo una tarea está completamente finalizada sigue siendo uno de los desafíos más persistentes de la robótica. Gemini Robotics ER 2 introduce mejoras significativas en comprensión de video y seguimiento de progreso, permitiendo a los robots verificar que tareas complejas — como ajustar una bombilla o atar una bolsa de basura — cumplan con las especificaciones antes de continuar.
Clasificación continua del progreso
La clasificación del progreso se refiere a la capacidad de un robot para monitorear la finalización de tareas en tiempo real. En las evaluaciones de Google, cada fotograma de una transmisión de video se asigna a uno de cinco niveles de progreso (0–20%, 20–40%, 40–60%, 60–80%, 80–100%). Al cuantificar el progreso de la tarea, el modelo proporciona a los robots conciencia situacional, permitiéndoles ajustar acciones sobre la marcha o reintentar pasos fallidos sin reiniciar un flujo de trabajo completo.
Gemini Robotics ER 2 alcanza un 57.4% de precisión en tareas de clasificación de progreso, superando a los modelos de generación anterior y a los modelos frontera competidores.
Búsqueda de momentos con precisión
La búsqueda de momentos mide la capacidad de un modelo para identificar el fotograma exacto del video donde ocurre un evento crítico — por ejemplo, cuándo dejar de verter café en una taza. Para tareas de búsqueda de momentos, Gemini Robotics ER 2 alcanza un 91.3% de precisión con una distancia media absoluta de 0.96 segundos. Según Google, este rendimiento compite estrechamente con categorías de modelos mucho más grandes, al tiempo que ofrece precisión con una fracción del costo computacional y cuatro veces la velocidad de ejecución — la latencia inferior a un segundo requerida para operar robots físicos de manera segura en entornos del mundo real.
Colaboración entre múltiples robots
Ningún robot único se adapta a todas las tareas: un rover con ruedas destaca en interiores, mientras que un robot humanoide puede desempeñarse mejor en terrenos irregulares. Gemini Robotics ER 2 introduce la colaboración entre múltiples robots, permitiendo que máquinas diversas se comuniquen mediante una comprensión semántica compartida para transferir y completar tareas complejas. Google ha demostrado esta capacidad con el Apollo 2 de Apptronik y el Franka F3 Duo trabajando en conjunto. Esto posiciona a Google junto a Amazon, que ha desplegado flotas heterogéneas de robots en centros de distribución, aunque esos sistemas dependen de la coordinación centralizada de gestión de almacén en lugar de comunicación semántica en tiempo real entre robots de diferentes marcas.
Mejora de la inteligencia espacial
Gemini Robotics ER 2 avanza las capacidades centrales de razonamiento espacial en tres evaluaciones de referencia:
- Detección de éxito/fracaso: Ahora opera con transmisiones de video en bruto en lugar de instantáneas estáticas, permitiendo que el modelo detecte fallos durante la ejecución, como derrames, resbalones o desalineaciones.
- Lectura general de instrumentos: Se extiende más allá de diales circulares e indicadores de nivel para incluir pantallas digitales, escalas lineales, reglas y termómetros de líquido. Google probó la capacidad en 10 tipos diferentes de instrumentos.
- VQA espacial mejorada: Mejora el Visual Question Answering (respuestas a preguntas visuales) a través de los avances de Gemini en comprensión multimodal.
El modelo alcanza de manera consistente la mayor precisión en todas las capacidades centrales, incluida la detección de éxito (imagen y video), respuesta a preguntas (ERQA) y lectura generalizada de instrumentos.
Avances en seguridad
Google describe a Gemini Robotics ER 2 como su modelo de robótica más seguro hasta la fecha, con mejoras significativas en las evaluaciones de seguimiento de instrucciones de seguridad y proximidad humana — métricas que evalúan qué tan bien un modelo cumple con las restricciones físicas durante tareas de razonamiento y su conciencia espacial para detectar humanos cercanos. Estas evaluaciones tienen un peso práctico a medida que la robótica industrial pasa de los despliegues tradicionales en jaulas a entornos colaborativos donde humanos y robots comparten espacios de trabajo.
En las pruebas, Gemini Robotics ER 2 detuvo con éxito un robot humanoide cuando una persona ingresó a su proximidad y reanudó el trabajo de forma autónoma solo una vez que el área estuvo despejada.
Google también está introduciendo una nueva evaluación que mide la capacidad de un modelo fundacional para actuar como un orquestador seguro de VLA. La evaluación prueba la capacidad de un modelo para hacer cumplir restricciones de seguridad, monitorear el entorno, evaluar la viabilidad física y solicitar aclaraciones humanas. Los detalles completos están disponibles en el informe técnico de seguridad.
Gemini Robotics ER 2 supera a ER 1.6 y a otros modelos frontera tanto en las evaluaciones de seguimiento de instrucciones de seguridad como en las de proximidad humana.
Perspectivas futuras
Google afirmó que planea llevar el modelo hacia tareas aún más complejas para acelerar el desarrollo de robots útiles y apoyar a la comunidad de robótica en general. Los desarrolladores pueden encontrar ejemplos de configuración y prompting en GitHub y consultar la tarjeta del modelo para obtener detalles adicionales.