НовостиАкцииGoogle выпускает аудиомодели Gemini 3.8 Live для ИИ-агентов реального времени

Google выпускает аудиомодели Gemini 3.8 Live для ИИ-агентов реального времени

Автор: AI Business·

Ключевые выводы

  • 15 сентября Google выпустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — аудиомодели, предназначенные для создания голосовых агентов, которые рассуждают и выполняют задачи в ходе живого разговора.
  • Модели могут выполнять вызовы API и инструментов, транслируя аудиоответы, принимать визуальные данные в реальном времени и поддерживают более 97 языков.
  • Версия Extended Thinking включает настраиваемое рассуждение — функцию, позволяющую включать или отключать внутренний процесс рассуждения модели.
  • Архитектура разделяет интерактивную задержку и задержку рассуждения, позволяя агентам поддерживать ход беседы, пока рассуждение продолжается в фоновом режиме, а не приостанавливать разговор в ожидании ответа.
  • Аналитики считают, что Google догоняет таких поставщиков, как Apple, одновременно развивая взаимодействие с ИИ в реальном времени; варианты применения включают чат-ботов клиентской поддержки, процессы продаж и мультимодальные агентные приложения.
Google выпускает аудиомодели Gemini 3.8 Live для ИИ-агентов реального времени

Google представила две новые аудиомодели, позволяющие компаниям развертывать интеллектуальных ИИ-агентов с более глубоким рассуждением, большей интерактивностью и разговорной скоростью.

Представленные 15 сентября Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking позволяют разработчикам создавать голосовых агентов, способных рассуждать и выполнять задачи, сохраняя естественный ход беседы, сообщила Google. Модели поддерживают взаимодействие в реальном времени без привычной структуры «запрос — ответ», позволяя пользователям вести естественный диалог вместо разрозненных запросов.

Ключевые возможности моделей включают выполнение вызовов API и инструментов — механизмов, с помощью которых агенты подключаются к внешним системам и выполняют задачи, — с одновременной потоковой передачей аудиоответов пользователю, прием визуальных данных в реальном времени, помогающих агентам понимать и то, что говорит пользователь, и то, что он видит, а также поддержку более 97 языков — диапазона, актуального для компаний, развертывающих голосовых агентов в разных регионах. Версия Extended Thinking добавляет настраиваемое рассуждение — функцию, позволяющую включать или отключать внутренний процесс рассуждения ИИ-модели.

Релиз вышел через две недели после того, как Google впервые представила базовые модели Gemini 3.8 Flash и 3.8 Cyber.

По словам аналитика Futurum Group Брэдли Шиммина, с возможностями 3.8 Live Google, похоже, догоняет таких поставщиков, как Apple, которая уже предлагает транскрипцию в реальном времени в приложениях для повышения продуктивности, таких как Notes и Voice Memos. При этом, отметил он, технологии Google выводят взаимодействие с ИИ на новый уровень, меняя то, как пользователи общаются с ИИ.

Настоящие разговоры

«По архитектуре… это можно настроить на множество разных моделей поведения», — сказал Шиммин. Он отметил, что хотя компании могут использовать модели для традиционных задач перевода, Google также спроектировала их так, чтобы пользователи взаимодействовали не по схеме «запрос — ответ», а вели настоящий разговор.

«Это просто естественный разговор с возможностью прервать его в реальном времени, чтобы что-то добавить», — сказал Шиммин. «Вы можете добавить контекст в беседу, не прерывая того, что она делает».

По словам основателя Tekonyx Сида Нага, благодаря передовым речевым технологиям Google новые модели не просто отвечают на вопрос буквально.

«Модель спроектирована так, чтобы вести фоновое рассуждение, — сказал Наг. — Она делает это во времяора, поэтому беседа не прерывается, пока модель рассуждает».

Эта технология представляет собой прогресс, при котором интерактивная задержка — промежуток между действием пользователя и реакцией системы — отделяется от задержки рассуждения, то есть общего времени, которое требуется ИИ-модели на обработку информации. Именно это разделение позволяет агенту поддерживать ход беседы, пока рассуждение продолжается в фоновом режиме, вместо того чтобы приостанавливать взаимодействие до готовности ответа.

«Это происходит в реальном времени, а не с остановкой и последующим возвратом с новым ответом», — сказал Наг.

Речевые модели также меняют то, как ИИ-агент отвечает и взаимодействует, поскольку «агенту больше не обязательно выбирать между быстротой и вдумчивостью», — продолжил Наг. «Он может действительно поддерживать взаимодействие в реальном времени».

По словам Нага, варианты применения новых моделей в компаниях включают чат-ботов клиентской поддержки, процессы продаж и мультимодальные агентные приложения, объединяющие текст, голос и видео. Агентные приложения — это программное обеспечение, в котором ИИ-агенты рассуждают и выполняют задачи, а не просто отвечают на запросы, — подход, опирающийся на вызов инструментов посреди разговора и фоновое рассуждение того типа, который обеспечивают новые модели.

Материал подготовлен Эстер Шитту, AI Business. Оригинальный материал: Gemini 3.8 Live Transforms Conversational AI, опубликован 17 сентября 2026 года.