НовостиАкцииGoogle DeepMind представляет Gemini 3.8 Live с Live Avatar

Google DeepMind представляет Gemini 3.8 Live с Live Avatar

Автор: Google DeepMind Blog·

Ключевые выводы

  • •Live Avatar позволяет корпоративным агентам слушать, видеть и отвечать с помощью синхронизированного аудио и видео почти в реальном времени.
  • •Система может выполнять инструменты и получать информацию в фоне, не прерывая активный разговор.
  • •Live Avatar поддерживает многоязычную синхронизацию «речь-в-речь» на 97 языках, включая переключение языков во время разговора.
  • •Организации могут выбирать готовые аватары, а создание собственных на основе референсных изображений ограничено внесёнными в список разрешённых предприятиями.
  • •Водяной знак SynthID встраивается в сгенерированное аудио и видео, помогая идентифицировать созданный ИИ контент.
Google DeepMind представляет Gemini 3.8 Live с Live Avatar

Google DeepMind представила Gemini 3.8 Live с Live Avatar 24 сентября 2026 года, добавив в свой диалоговый ИИ визуальное присутствие почти в реальном времени. Функция объединяет нативные возможности живого диалога Gemini с потоковым видео с низкой задержкой, создавая более естественные и интуитивные взаимодействия для предприятий и их пользователей.

Авторами объявления выступили Шу-Иинь Чанг (Shuo-yiin Chang), научный сотрудник, и Си-Джей Чжэн (CJ Zheng), инженер-программист, от имени аудиокоманды Gemini. Анонс последовал за запуском Gemini 3.8 Live на прошлой неделе.

По данным Google DeepMind, Live Avatar сочетает генерацию видео почти в реальном времени с речью, чтобы система могла слушать, видеть и говорить через динамический визуальный персонаж. Функция разработана с точной синхронизацией губ, естественной мимикой и плавной сменой реплик, что позволяет сделать виртуальные сервисы более интерактивными. Среди возможных применений компания называет клиентское обслуживание и интерактивные пошаговые инструкции.

Gemini 3.8 Live с Live Avatar доступна уже сегодня в Gemini Enterprise. Оригинальное объявление опубликовано в блоге Google DeepMind.

Мультимодальные разговоры

Google DeepMind отметила, что разговор по своей природе мультимодален: он включает слушание, визуальное внимание, речь и мимику. Live Avatar переносит эти возможности в корпоративных агентов, одновременно обрабатывая визуальные и аудиовходные данные и формя ответы, сочетающие выразительное аудио и видео.

Компания представила функцию как способную воспринимать увиденное и услышанное почти в реальном времени, а затем отвечать аудио и видео для более естественного разговора. Для описанных Google DeepMind сценариев клиентского обслуживания и интерактивных инструкций практический результат — виртуальный агент, реагирующий на то, что ему показывают, и отвечающий голосом и мимикой в рамках одного разговора.

Фоновое выполнение инструментов

Live Avatar также использует возможности рассуждения Gemini и асинхронный вызов инструментов. Она может инициировать вызовы инструментов и получать данные в фоне, продолжая активный диалог. Это позволяет справляться со сложными задачами, не прерывая разговор.

В качестве примера Google DeepMind привела заселение гостя в отель — задачу, при которой инструменты работают в фоне, пока разговор продолжается. Для предприятий ценность заключается в непрерывности: клиенты experience непрерывный диалог, а получение данных и выполнение задач остаются незаметными.

Поддержка 97 языков

Функция включает нативную многоязычную синхронизацию «речь-в-речь». Google DeepMind сообщила, что Live Avatar может динамически адаптировать синхронизацию губ и мимику при переключении между 97 языками, не ухудшая качество видео и не вызывая визуальных искажений.

Компания также продемонстрировала переключение языков посреди разговора, при котором синхронизация губ и мимика аватара плавно адаптируются. Для компаний, обслуживающих пользователей в разных регионах, такой охват — и возможность переключать языки без визуальных артефактов — напрямую касается глобального взаимодействия с клиентами.

Настраиваемые аватары

Организации могут выбирать из библиотеки готовых аватаров с разной внешностью, голосами и стилями выразительности. Они также могут настраивать Live Avatar, отражая бренд или характер персонажа.

Используя качественное референсное изображение, разработчики могут создать полностью анимированного и отзывчивого аватара, сохранив сходство с оригиналом, фирменный стиль или идентичность персонажа. Google DeepMind уточнила, что создание собственных аватаров пока доступно только через список разрешённых предприятий, поэтому библиотека готовых аватаров остаётся вариантом для остальных организаций.

Водяные знаки и безопасность

Google DeepMind сообщила, что Live Avatar включает строгие меры защиты, призванные уважать идентичность и сохранять прозрачность контента, созданного ИИ. Весь результат, сгенерированный продуктами компании на базе ИИ, помечается водяным знаком SynthID — незаметным водяным знаком, встраиваемым непосредственно в аудио и видео.

По словам компании, водяной знак помогает поддерживать обнаруживаемость ИИ-контента и призван свести к минимуму дезинформацию и ошибочную атрибуцию. Для предприятий, предлагающих клиентамительных видеоаватаров, водяной знак — это то, что позволяет идентифицировать такие взаимодействия как созданные ИИ. Подробнее о подходе компании к безопасности и ответственному развертыванию можно узнать из её карточки модели.

Gemini 3.8 Live с Live Avatar доступна в Gemini Enterprise. Google DeepMind также направила разработчиков к документации API для начала работы. Командам, которым нужны аватары под конкретный бренд сверх библиотеки готовых, следует следить за доступом к списку разрешённых предприятий для создания собственных аватаров.