Google DeepMind представляет Gemini 3.8 Live с Live Avatar
Ключевые выводы
- •Live Avatar позволяет корпоративным агентам слушать, видеть и отвечать с помощью синхронизированного аудио и видео почти в реальном времени.
- •Система может выполнять инструменты и получать информацию в фоне, не прерывая активный разговор.
- •Live Avatar поддерживает многоязычную синхронизацию «речь-в-речь» на 97 языках, включая переключение языков во время разговора.
- •Организации могут выбирать готовые аватары, а создание собственных на основе референсных изображений ограничено внесёнными в список разрешённых предприятиями.
- •Водяной знак SynthID встраивается в сгенерированное аудио и видео, помогая идентифицировать созданный ИИ контент.

Google DeepMind представила Gemini 3.8 Live с Live Avatar 24 сентября 2026 года, добавив в свой диалоговый ИИ визуальное присутствие почти в реальном времени. Функция объединяет нативные возможности живого диалога Gemini с потоковым видео с низкой задержкой, создавая более естественные и интуитивные взаимодействия для предприятий и их пользователей.
Авторами объявления выступили Шу-Иинь Чанг (Shuo-yiin Chang), научный сотрудник, и Си-Джей Чжэн (CJ Zheng), инженер-программист, от имени аудиокоманды Gemini. Анонс последовал за запуском Gemini 3.8 Live на прошлой неделе.
По данным Google DeepMind, Live Avatar сочетает генерацию видео почти в реальном времени с речью, чтобы система могла слушать, видеть и говорить через динамический визуальный персонаж. Функция разработана с точной синхронизацией губ, естественной мимикой и плавной сменой реплик, что позволяет сделать виртуальные сервисы более интерактивными. Среди возможных применений компания называет клиентское обслуживание и интерактивные пошаговые инструкции.
Gemini 3.8 Live с Live Avatar доступна уже сегодня в Gemini Enterprise. Оригинальное объявление опубликовано в блоге Google DeepMind.
Мультимодальные разговоры
Google DeepMind отметила, что разговор по своей природе мультимодален: он включает слушание, визуальное внимание, речь и мимику. Live Avatar переносит эти возможности в корпоративных агентов, одновременно обрабатывая визуальные и аудиовходные данные и формя ответы, сочетающие выразительное аудио и видео.
Компания представила функцию как способную воспринимать увиденное и услышанное почти в реальном времени, а затем отвечать аудио и видео для более естественного разговора. Для описанных Google DeepMind сценариев клиентского обслуживания и интерактивных инструкций практический результат — виртуальный агент, реагирующий на то, что ему показывают, и отвечающий голосом и мимикой в рамках одного разговора.
Фоновое выполнение инструментов
Live Avatar также использует возможности рассуждения Gemini и асинхронный вызов инструментов. Она может инициировать вызовы инструментов и получать данные в фоне, продолжая активный диалог. Это позволяет справляться со сложными задачами, не прерывая разговор.
В качестве примера Google DeepMind привела заселение гостя в отель — задачу, при которой инструменты работают в фоне, пока разговор продолжается. Для предприятий ценность заключается в непрерывности: клиенты experience непрерывный диалог, а получение данных и выполнение задач остаются незаметными.
Поддержка 97 языков
Функция включает нативную многоязычную синхронизацию «речь-в-речь». Google DeepMind сообщила, что Live Avatar может динамически адаптировать синхронизацию губ и мимику при переключении между 97 языками, не ухудшая качество видео и не вызывая визуальных искажений.
Компания также продемонстрировала переключение языков посреди разговора, при котором синхронизация губ и мимика аватара плавно адаптируются. Для компаний, обслуживающих пользователей в разных регионах, такой охват — и возможность переключать языки без визуальных артефактов — напрямую касается глобального взаимодействия с клиентами.
Настраиваемые аватары
Организации могут выбирать из библиотеки готовых аватаров с разной внешностью, голосами и стилями выразительности. Они также могут настраивать Live Avatar, отражая бренд или характер персонажа.
Используя качественное референсное изображение, разработчики могут создать полностью анимированного и отзывчивого аватара, сохранив сходство с оригиналом, фирменный стиль или идентичность персонажа. Google DeepMind уточнила, что создание собственных аватаров пока доступно только через список разрешённых предприятий, поэтому библиотека готовых аватаров остаётся вариантом для остальных организаций.
Водяные знаки и безопасность
Google DeepMind сообщила, что Live Avatar включает строгие меры защиты, призванные уважать идентичность и сохранять прозрачность контента, созданного ИИ. Весь результат, сгенерированный продуктами компании на базе ИИ, помечается водяным знаком SynthID — незаметным водяным знаком, встраиваемым непосредственно в аудио и видео.
По словам компании, водяной знак помогает поддерживать обнаруживаемость ИИ-контента и призван свести к минимуму дезинформацию и ошибочную атрибуцию. Для предприятий, предлагающих клиентамительных видеоаватаров, водяной знак — это то, что позволяет идентифицировать такие взаимодействия как созданные ИИ. Подробнее о подходе компании к безопасности и ответственному развертыванию можно узнать из её карточки модели.
Gemini 3.8 Live с Live Avatar доступна в Gemini Enterprise. Google DeepMind также направила разработчиков к документации API для начала работы. Командам, которым нужны аватары под конкретный бренд сверх библиотеки готовых, следует следить за доступом к списку разрешённых предприятий для создания собственных аватаров.