НовостиАкцииGoogle DeepMind запускает Gemini Robotics ER 2 для пространственного анализа в реальном времени и совместной работы нескольких роботов

Google DeepMind запускает Gemini Robotics ER 2 для пространственного анализа в реальном времени и совместной работы нескольких роботов

Автор: Google DeepMind Blog·

Ключевые выводы

  • Google DeepMind представила Gemini Robotics ER 2 как высокоуровневую модель рассуждения, которая передает физическое исполнение специализированным vision-language-action моделям.
  • Система интегрируется с Gemini Live API и обеспечивает отклик менее секунды, что помогает роботам работать плавно и безопасно.
  • Разработчики могут использовать Gemini API и Google AI Studio для создания интерактивных физических ИИ-агентов.
  • Модель поддерживает совместную работу нескольких роботов, позволяя разным машинам взаимодействовать через общее семантическое понимание.
  • Google называет ее самой безопасной робототехнической моделью на сегодня, с улучшенным пространственным восприятием, позволяющим останавливать робота при приближении человека.
Google DeepMind запускает Gemini Robotics ER 2 для пространственного анализа в реальном времени и совместной работы нескольких роботов

Google DeepMind запускает Gemini Robotics ER 2 для пространственного анализа в реальном времени и совместной работы нескольких роботов

Google DeepMind выпустила Gemini Robotics ER 2 — свою наиболее способную модель embodied reasoning, предназначенную для выполнения роли высокоуровневого «мозга» для роботов. Модель обеспечивает пространственное понимание в реальном времени, планирование многошаговых задач и взаимодействие между разными роботами, что является значительным обновлением по сравнению с предшественником, Gemini Robotics ER 1.6. Этот релиз усиливает конкуренцию на формирующемся рынке универсальных foundation-моделей для робототехники, где игроки, включая NVIDIA с Project GR00T, Figure AI, Physical Intelligence и программу Tesla Optimus, стремятся создать ИИ-системы, способные управлять физическими машинами в самых разных задачах.

Gemini Robotics ER 2 теперь публично доступна разработчикам через Gemini API, Google AI Studio и в закрытом предварительном доступе на Gemini Enterprise Agent Platform. Разработчики могут использовать ее для создания физических ИИ-агентов, которые взаимодействуют с людьми, понимают физический мир и планируют многошаговые задачи, передавая исполнение движений более низкоуровневым vision-language-action (VLA) моделям. Эта многоуровневая архитектура — где модель рассуждения организует решения верхнего уровня и делегирует физическое управление специализированным моделям исполнения — отражает подход, общий для ряда инициатив в робототехническом ИИ, как альтернатива единой end-to-end модели, пытающейся охватить все: от восприятия до моторного контроля.

Модель также может нативно вызывать инструменты, такие как Google Search, или любую пользовательскую функцию. Такая архитектура позволяет роботу «думать» о следующем шаге, одновременно выполняя текущие действия, что делает работу более плавной.

Развитие возможностей физических агентных систем

Большинство задач в физическом мире требуют нескольких шагов. Gemini Robotics ER 2 выступает как физический агент, который координирует шаги, обеспечивает самокоррекцию и лучше обобщает новые ситуации. Чтобы построить агентную систему, разработчики могут объявлять низкоуровневые интерфейсы управления — например, модели Vision-Language-Action (VLA) или API навигации — как инструменты и напрямую передавать в модель мультимодальные видео, аудио или текстовые данные.

Google сообщает, что Gemini Robotics ER 2 стабильно превосходит ER 1.6 в оркестрации инструментов во всех трех режимах управления: реальный VLA, симулированный VLA и человеческое телеуправление.

Высокоуровневое рассуждение в робототехнике во многом зависит от скорости исполнения. Gemini Robotics ER 2 интегрируется с Gemini Live API, используя двунаправленную потоковую конечную точку, оптимизированную для задач с высокой чувствительностью к задержке. Результатом становится плавная оркестрация, при которой модель отдает команды моделям действий и робототехническим API для выполнения многошаговых задач без резких пауз «остановиться и подумать», типичных для более ранних систем. Задержки менее секунды давно являются необходимым условием безопасного замкнутого управления роботами; достижение этого показателя в системе на базе большой языковой модели сокращает разрыв между когнитивным планированием и физической реакцией, который исторически ограничивал реальное внедрение.

Чтобы продемонстрировать эти возможности, Google создала демо с использованием Spot от Boston Dynamics. Gemini Robotics ER 2 оркестрирует Spot APIs — например, навигацию и движение манипулятора — создавая интерактивного робота, который по команде на естественном языке приносит предметы. Код доступен на GitHub вместе с другими примерами.

Темпоральный интеллект для надежного завершения задач

Определение момента, когда задача полностью завершена, остается одной из самых сложных проблем робототехники. Gemini Robotics ER 2 обеспечивает качественный скачок в понимании видео и отслеживании прогресса, позволяя роботам проверять, что сложные задачи — например, затягивание лампочки или завязывание мусорного мешка — соответствуют требованиям перед переходом к следующему шагу.

Непрерывная классификация прогресса

Классификация прогресса — это способность робота отслеживать выполнение задачи в реальном времени. В оценках Google каждый кадр видеопотока относится к одному из пяти уровней прогресса (0–20%, 20–40%, 40–60%, 60–80%, 80–100%). Количественная оценка прогресса дает роботам ситуационную осведомленность и позволяет им корректировать действия на лету или повторять неудачные шаги без перезапуска всего процесса.

Gemini Robotics ER 2 достигает точности 57.4% в задачах классификации прогресса, превосходя модели предыдущего поколения и конкурирующие передовые модели.

Точное определение момента

Moment-finding измеряет способность модели определить точный кадр видео, в котором происходит критическое событие — например, момент, когда нужно перестать наливать кофе в чашку. В задачах moment-finding Gemini Robotics ER 2 показывает заметный рост качества, позволяя роботам точно переключаться между задачами, проверять успех и предлагать исправления.

В задачах moment-finding Gemini Robotics ER 2 достигает точности 91.3% и средней абсолютной дистанции 0.96s. Она сопоставима с гораздо более крупными классами моделей, но обеспечивает такую точность при значительно меньших вычислительных затратах и в 4 раза большей скорости исполнения — при субсекундной задержке, которая действительно необходима для безопасной работы физических роботов в реальном мире.

Совместная работа нескольких роботов

Один робот не подходит для всех задач — колесный ровер хорош в помещениях, тогда как гуманоидный робот может лучше справляться с неровной поверхностью. Gemini Robotics 2 обеспечивает совместную работу нескольких роботов, позволяя разным машинам взаимодействовать через общее семантическое понимание, передавать друг другу задачи и завершать сложные процессы. Посмотрите, как Gemini Robotics ER 2 позволяет Apollo 2 от Apptronik и Franka F3 Duo работать вместе здесь.

Улучшение общего пространственного интеллекта

Gemini Robotics ER 2 развивает ключевые возможности пространственного рассуждения, что подтверждается тремя бенчмарками:

  • Обнаружение успеха/неудачи: теперь работает с сырыми видеопотоками, а не со статичными снимками, чтобы фиксировать сбои в ходе выполнения, такие как проливы, скольжения или несоосности.
  • Общее считывание приборов: выходит за рамки круглых шкал и смотровых стекол и включает цифровые дисплеи, линейные шкалы, линейки и жидкостные термометры. Модель тестировалась на 10 разных типах приборов.
  • Улучшенное пространственное VQA: улучшает Visual Question Answering благодаря достижениям Gemini в мультимодальном понимании.

Gemini Robotics ER 2 стабильно показывает наивысшую точность по всем ключевым возможностям, включая обнаружение успеха (изображение и видео), Question Answering (ERQA) и обобщенное считывание приборов.

Повышение безопасности воплощенного интеллекта

Gemini Robotics ER 2 — наша самая безопасная модель, демонстрирующая существенный прогресс в бенчмарках Safety Instruction Following и Human Proximity, которые оценивают, насколько модель соблюдает физические ограничения в ходе рассуждений, а также ее пространственную осведомленность для обнаружения людей. Мы обнаружили, что Gemini Robotics ER 2 успешно останавливает гуманоидного робота, когда рядом находится человек, и автономно возобновляет работу только после того, как пространство освобождается.

Чтобы продвинуть безопасность физических агентов, мы представляем бенчмарк, оценивающий способность foundation-модели выступать в роли безопасного VLA-оркестратора: он проверяет умение соблюдать ограничения безопасности, отслеживать окружающую среду, оценивать физическую реализуемость и запрашивать уточнение у человека. Подробности см. в нашем техническом отчете по безопасности.

Gemini Robotics ER 2 превосходит ER 1.6 и другие передовые модели по бенчмаркам Safety Instruction Following и Human Proximity.

В дальнейшем мы планируем развивать эти модели для еще более сложных задач, чтобы ускорить создание полезных роботов и поддержать сообщество робототехники.