Google DeepMind lance Gemini Robotics ER 2 pour le raisonnement spatial en temps réel et la collaboration multi-robots
Points clés
- •Le nouveau Gemini Robotics ER 2 de Google DeepMind agit comme un cerveau de raisonnement de haut niveau qui délègue l’exécution physique à des modèles vision-langage-action spécialisés.
- •Le système s’intègre à Gemini Live API pour atteindre des temps de réponse inférieurs à la seconde, permettant des opérations robotiques fluides et sûres.
- •Les développeurs peuvent accéder à la plateforme via le Gemini API et Google AI Studio pour créer des agents d’IA physique interactifs.
- •Le modèle introduit des capacités de collaboration multi-robots, permettant à des machines שונות de communiquer grâce à une compréhension sémantique partagée.
- •Google considère qu’il s’agit de son modèle de robotique le plus sûr à ce jour, avec une conscience spatiale avancée qui arrête les robots lorsque des humains sont à proximité.

Google DeepMind lance Gemini Robotics ER 2 pour le raisonnement spatial en temps réel et la collaboration multi-robots
Google DeepMind a lancé Gemini Robotics ER 2, le modèle de « raisonnement incarné » le plus avancé de l’entreprise, conçu pour servir de cerveau de haut niveau aux robots. Le modèle permet un raisonnement spatial en temps réel, la planification de tâches en plusieurs étapes et la collaboration entre différents robots, ce qui représente une amélioration significative par rapport à son prédécesseur, Gemini Robotics ER 1.6. Cette publication accentue la concurrence sur le marché émergent des modèles de fondation pour la robotique généraliste, où des acteurs comme NVIDIA avec Project GR00T, Figure AI, Physical Intelligence et le programme Optimus de Tesla se disputent la construction de systèmes d’IA capables de contrôler des machines physiques pour des tâches variées.
Gemini Robotics ER 2 est désormais accessible publiquement aux développeurs via le Gemini API, Google AI Studio et en préversion privée sur la Gemini Enterprise Agent Platform. Les développeurs peuvent l’utiliser pour créer des agents d’IA physique capables d’échanger avec des humains, de comprendre le monde physique et de planifier des tâches en plusieurs étapes avant de déléguer l’exécution motrice à des modèles vision-langage-action (VLA) de niveau inférieur. Cette architecture en couches — dans laquelle un modèle de raisonnement orchestre les décisions de haut niveau et délègue le contrôle physique à des modèles d’exécution spécialisés — reflète une philosophie de conception partagée par plusieurs initiatives d’IA pour la robotique, en alternative aux modèles de bout en bout uniques qui tentent de tout gérer, de la perception au contrôle moteur, dans un seul système.
Le modèle peut appeler nativement des outils tels que Google Search ou toute fonction définie par l’utilisateur. Son architecture permet à un robot de « penser » à l’étape suivante tout en exécutant simultanément ses actions en cours, ce qui favorise un fonctionnement plus fluide.
Faire progresser les capacités agentiques physiques
La plupart des tâches dans le monde physique nécessitent plusieurs étapes. Gemini Robotics ER 2 fonctionne comme un agent physique qui orchestre les étapes, permet l’auto-correction et généralise à des situations nouvelles. Les développeurs peuvent déclarer des interfaces de contrôle de bas niveau — notamment des modèles VLA ou des API de navigation — comme outils et diffuser directement dans le modèle des flux multimodaux de vidéo, d’audio ou de texte.
Google indique que Gemini Robotics ER 2 surpasse régulièrement ER 1.6 pour l’orchestration d’outils dans trois modes de contrôle : VLA réel, VLA simulé et téléopération humaine.
Dans la robotique, le raisonnement de haut niveau dépend fortement de la vitesse d’exécution. Gemini Robotics ER 2 s’intègre à Gemini Live API, en utilisant un point de terminaison de streaming bidirectionnel optimisé pour les tâches sensibles à la latence. Le résultat est une orchestration fluide dans laquelle le modèle commande des modèles d’action et des API robotiques pour accomplir des tâches en plusieurs étapes sans les pauses brusques de type « s’arrêter et réfléchir » propres aux systèmes plus anciens. Pour illustrer cela, Google a construit une démonstration avec Spot de Boston Dynamics. Gemini Robotics ER 2 orchestre les API Spot — telles que la navigation et le mouvement du manipulateur — afin de créer un robot interactif qui récupère des objets sur commande en langage naturel. Le code est disponible sur GitHub, avec d’autres exemples.
Intelligence temporelle pour une exécution fiable des tâches
L’un des défis les plus difficiles en robotique est de savoir quand une tâche est terminée. Gemini Robotics ER 2 apporte une amélioration majeure de la compréhension vidéo et du suivi de progression pour vérifier que des tâches complexes — comme serrer une ampoule ou nouer un sac-poubelle — sont conformes aux spécifications avant de passer à l’étape suivante.
Classification continue de la progression
La classification de la progression désigne la capacité d’un robot à suivre l’avancement vers l’achèvement d’une tâche en temps réel. Dans les évaluations de Google, chaque image d’un flux vidéo est classée dans l’un des cinq niveaux de progression (0–20 %, 20–40 %, 40–60 %, 60–80 %, 80–100 %). En quantifiant l’avancement d’une tâche, le modèle donne aux robots une perception de la situation en temps réel, leur permettant d’ajuster leurs actions à la volée ou de réessayer des étapes échouées sans redémarrer tout un workflow.
Gemini Robotics ER 2 atteint une précision de 57.4 % sur les tâches de classification de la progression, surpassant les modèles de génération précédente et les modèles de pointe concurrents.
Détection précise du moment
La détection du moment mesure la capacité d’un modèle à identifier l’image vidéo exacte où se produit un événement critique — par exemple, le moment où il faut arrêter de verser du café dans une tasse. Pour les tâches de détection du moment, Gemini Robotics ER 2 atteint une précision de 91.3 % avec une distance absolue moyenne de 0.96 s. Selon Google, ces performances rivalisent de près avec des catégories de modèles beaucoup plus grandes, tout en offrant cette précision à une fraction du coût de calcul et avec une vitesse d’exécution 4 fois supérieure — la latence inférieure à la seconde nécessaire pour exploiter en toute sécurité des robots physiques dans le monde réel.
Collaboration multi-robots
Aucun robot unique ne convient à toutes les tâches : un rover à roues excelle en intérieur, tandis qu’un robot humanoïde peut mieux fonctionner sur un terrain accidenté. Gemini Robotics ER 2 introduit la collaboration multi-robots, permettant à des machines diverses de communiquer via une compréhension sémantique partagée pour se relayer et accomplir des tâches complexes. Voir comment Gemini Robotics ER 2 permet à Apollo 2 d’Apptronik et à Franka F3 Duo de collaborer ici.
Améliorer l’intelligence spatiale générale
Gemini Robotics ER 2 fait progresser nos capacités de raisonnement spatial de base, comme le montrent trois benchmarks :
Détection des succès/échecs : fonctionne désormais sur des flux vidéo bruts plutôt que sur des instantanés statiques afin de détecter les échecs en cours d’exécution, comme des déversements, des glissements ou des désalignements.
Lecture générale d’instruments : s’étend au-delà des cadrans circulaires et des voyants pour inclure les affichages numériques, les règles graduées, les mètres rubans et les thermomètres à liquide. Nous l’avons testé sur 10 types d’instruments différents.
VQA spatiale améliorée : améliore le Visual Question Answering grâce aux avancées de Gemini en compréhension multimodale.
Gemini Robotics ER 2 obtient systématiquement la meilleure précision sur toutes les capacités de base, notamment la détection des succès (image/vidéo), le Question Answering (ERQA) et la lecture généralisée d’instruments.
Faire progresser la sécurité de l’intelligence incarnée
Gemini Robotics ER 2 est notre modèle le plus sûr à ce jour, avec des gains significatifs sur les benchmarks Safety Instruction Following et Human Proximity, qui évaluent la manière dont un modèle respecte les contraintes physiques pendant les tâches de raisonnement et sa perception spatiale pour détecter les humains. Nous avons constaté que Gemini Robotics ER 2 arrête avec succès un robot humanoïde lorsqu’une personne se trouve à proximité, puis reprend automatiquement son travail uniquement lorsque la zone est dégagée.
Pour faire progresser la sécurité des agents physiques, nous introduisons un benchmark qui évalue la capacité d’un modèle de fondation à agir comme un orchestrateur VLA sûr, en testant sa capacité à appliquer des contraintes de sécurité, surveiller l’environnement, évaluer la faisabilité physique et demander des clarifications à un humain. Pour plus de détails, consultez notre rapport technique sur la sécurité.
Gemini Robotics ER 2 surpasse ER 1.6 et d’autres modèles de pointe sur les benchmarks Safety Instruction Following et Human Proximity.
À l’avenir, nos plans sont de pousser ces modèles vers des tâches encore plus complexes afin d’accélérer le développement de robots utiles et de soutenir la communauté robotique.
Recevez les dernières actualités de Google dans votre boîte de réception
Inscrivez-vous à nos newsletters pour recevoir des mises à jour produit, des informations sur les événements, des offres spéciales et plus encore.
C’est fait. Encore une étape.
Vérifiez votre boîte de réception pour confirmer votre abonnement.
Vous pouvez également vous abonner avec une autre adresse e-mail.
Vos informations seront utilisées conformément à la politique de confidentialité de Google. Vous pouvez vous désinscrire à tout moment.