НовостиАкцииGoogle DeepMind представляет Gemini 3.8 Live и 3.8 Live Extended Thinking для естественно голосового ИИ

Google DeepMind представляет Gemini 3.8 Live и 3.8 Live Extended Thinking для естественно голосового ИИ

Автор: Google DeepMind Blog·

Ключевые выводы

  • Google DeepMind запустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking 15 сентября 2026 года, назвав их своими самыми продвинутыми моделями живого диалога на сегодняшний день.
  • Gemini 3.8 Live Extended Thinking заняла первое общее место в Speech to Speech Quality Index от Artificial Analysis, набрав 68,6% в агентном бенчмарке τ-Voice и 97,7% в Big Bench Audio.
  • Модели обрабатывают визуальные данные почти в реальном времени, автоматически переключаются между 97 поддерживаемыми языками во время разговора и выполняют инструменты и вызовы API в фоне, пока беседа продолжается.
  • Gemini 3.8 Live ориентирована на масштабирование и экономическую эффективность, а Extended Thinking создана для высокосложных задач с одновременными рассуждениями и речью, включая повествование о прогрессе в реальном времени.
  • Обе модели доступны уже сегодня через Gemini API и Google AI Studio, с корпоративным и потребительским развертыванием в Gemini Enterprise, Google Workspace, Search Live и приложении Gemini.
Google DeepMind представляет Gemini 3.8 Live и 3.8 Live Extended Thinking для естественно голосового ИИ

Google DeepMind объявила 15 сентября 2026 года о запуске Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — по заявлению компании, своих самых продвинутых моделей живого диалога на сегодняшний день. Согласно анонсу, две модели обеспечивают прогресс в рассуждениях в режиме, близком к реальному времени, для более эффективной работы голосовых агентов, с крупными улучшениями в области интеллекта и параллельных рассуждений, делающими их более удобными для совместной работы и лучше подходящими для выполнения сложных задач с помощью голоса.

Авторами публикации выступили Том Оуянг, старший инженер (Principal Engineer), и Малини Джаганатан, сотрудник технического персонала (Member of Technical Staff), от имени команды Gemini Audio.

Google сообщила, что запуск призван сделать голосовое взаимодействие более естественным, плавным и интеллектуальным. Новые модели обрабатывают сложные рассуждения, визуальный контекст в реальном времени и выполнение фоновых задач, не прерывая текущий разговор. Они могут справляться с перебиваниями, переключаться между языками и объяснять ход своих рассуждений во время работы — поведение, которое Google характеризует как шаг к ИИ, ощущаемому как настоящий собеседник. Независимо от того, решает ли пользователь сложную задачу или просто беседует, по словам компании, взаимодействие задумано так, чтобы ощущалось, будто ИИ действительно слушает и думает вместе с вами. Функции доступны уже сегодня через Gemini API, Google Workspace и приложение Gemini.

Две модели ориентированы на разные сценарии использования:

  • Gemini 3.8 Live создана для масштабирования и экономической эффективности, сочетая разговорный интеллект с плавным диалогом и визуальным заземлением.
  • Gemini 3.8 Live Extended Thinking создана для высокосложных задач с повышенным интеллектом и многошаговыми рассуждениями.

Для разработчиков и предприятий Google представляет модели как строительные блоки для надежных голосовых агентов, готовых к промышленной эксплуатации. Компания также заявляет, что они делают общение с Gemini в приложении Gemini, Google Workspace и Поиске более плавным и совместным, помогая пользователям решать сложные одним лишь голосом.

Бенчмарки и производительность

Gemini 3.8 Live Extended Thinking обеспечивает, по описанию Google, выполнение задач корпоративного уровня и интеллект, заняв первое общее место в Speech to Speech Quality Index от Artificial Analysis со результатом .6. Модель лидирует в агентном выполнении задач, набрав 68,6% в τ-Voice и 35,1% в бенчмарке τ-Voice-banking от Sierra. Она также демонстрирует сильные способности к рассуждениям, набрав 97,7% в Big Bench Audio, сохраняя при этом высоко конкурентную цену по сравнению с другими передовыми моделями.

Gemini 3.8 Live показала высокую предпочтительность среди пользователей, заняв второе место в Speech Agent Arena. Помимо этого результата, по словам Google, модель остается высоко экономически эффективной, предоставляя разработчикам и предприятиям мощную и эффективную модель, созданную для масштабирования.

В EVA-Bench от ServiceNow — бенчмарке для оценки голосовых агентов — модели Google, как сообщается, продвигают границу Парето для сложных рабочих процессов, успешно балансируя точность и качество диалога. Компания отмечает, что оценка проводилась на Live API платформы Gemini Enterprise Agent Platform.

Визуальный контекст, 97 языков и фоновое выполнение

Gemini 3.8 Live обрабатывает визуальные данные в режиме, близком к реальному времени, обогащая разговор контекстом для более полезных ответов. Модель автоматически определяет и переключается между 97 поддерживаемыми языками во время разговора. Она также выполняет инструменты и вызовы API в фоновом режиме, пока разговор продолжается, позволяя подтверждать запросы и продолжать общение, пока задачи завершаются в фоне.

Видеодемонстрации, опубликованные вместе с анонсом, показывают, как модель в реальном времени помогает при адаптации сотрудников, используя визуальный контекст для ответов на текущие вопросы, и как она играет в шахматы почти в реальном времени, сочетая визуальный контекст, рассуждения и естественный ход беседы.

Рассуждение и речь одновременно

Для задач, требующих более глубоких рассуждений, Gemini 3.8 Live Extended Thinking размышляет и говорит одновременно. По словам Google, модель обеспечивает повышенный интеллект для сложных рабочих процессов, сохраняя непрерывный ход беседы. Она использует ранние словесные сигналы, такие как «Дайте мне проверить…», чтобы естественно подтверждать запросы, и предоставляет поворот прогресса в реальном времени, сопровождая пользователей через многошаговые фоновые задачи по мере их выполнения.

Демонстрации включают преобразование Gemini 3.8 Live Extended Thinking черновых эскизов и почти мгновенной голосовой обратной связи в работающие React-компоненты, а также координацию многошаговых бронирований и асинхронных вызовов функций без прерывания естественного живого разговора. Google также показала, как Gemini 3.8 Live создает полные бизнес-планы и кастомные маркетинговые наборы на лету с помощью естественной речи.

Интеграция с Google Workspace и Поиском

В Google Workspace и Поиске модели Live призваны обеспечивать более интуитивный, совместный опыт, особенно при решении самых сложных задач. Gemini 3.8 Live Extended Thinking доступна в Google Workspace через Docs Live, Gmail Live и Live. Search Live предлагает пошаговую помощь по устранению неполадок в реальном времени на базе Gemini 3.8 Live.

Экосистема голосовых решений для разработчиков и предприятий

Используя Gemini Live API, платформы разработки, включая Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents, позволяют разработчикам легко создавать и развертывать высокопроизводительные голосовые интерфейсы. Эти платформы управляют сложной инфраструктурой потоковой передачи медиа в реальном времени за кулисами, позволяя разработчикам полностью сосредоточиться на создании пользовательского опыта.

Google добавила, что сотрудничает с компаниями, включая Salesforce, Genspark и Lumeris, которые высоко оценивают 3.8 Live и 3.8 Live Extended Thinking, отмечая впечатляющую задержку, плавность и возможности вызова инструментов моделей.

Водяные знаки SynthID для прозрачности

Весь аудиоконтент, созданный продуктами ИИ Google, снабжен водяным знаком SynthID. По словам компании, этот незаметный водяной знак вплетен непосредственно в аудиовыход, обеспечивая обнаруживаемость контента, созданного ИИ, для противодействия дезинформации. Подробности о подходе компании к безопасности и ответственности Google предлагает изучить в карточке модели.

Доступность

Обе модели начинают развертывание сегодня на платформах для разработчиков, в корпоративном и потребительском сегментах.

Gemini 3.8 Live:

  • Для разработчиков: в Gemini API и Google AI Studio.
  • Для предприятий: в закрытой превью в Gemini Enterprise, а вскоре — в Gemini Enterprise for Customer Experience.
  • Для всех: в Search Live.

Gemini 3.8 Live Extended Thinking:

  • Для разработчиков: в Gemini API и Google AI Studio.
  • Для предприятий: в закрытой превью в Gemini Enterprise, а вскоре — в Gemini Enterprise for Customer Experience и для бизнес-клиентов Google Workspace.
  • Для всех: в Gemini Live, для подписчиков Google AI Pro и Ultra в Workspace в Docs, а также для всех подписчиков Google AI в Gmail и Keep.

Полный анонс, включая видеодемонстрации, доступен в блоге Google DeepMind.