НовостиАкцииGoogle DeepMind представляет Gemini 3.5 Transcribe для распознавания речи в реальном времени

Google DeepMind представляет Gemini 3.5 Transcribe для распознавания речи в реальном времени

Автор: Google DeepMind Blog·

Ключевые выводы

  • Google заявила, что Gemini 3.5 Transcribe — самая точная на сегодня модель преобразования речи в текст, созданная для рабочих процессов с голосовым управлением.
  • Модель предлагает потоковую транскрибацию в реальном времени через Live API и обработку записанного аудио с атрибуцией говорящего и временными метками через Interactions API.
  • Google сообщила, что модель поддерживает более 85 языков, пользовательскую лексику, переключение языков в ходе разговора и определение нескольких говорящих для до трех участников в предварительно записанном аудио.
  • Компания заявила, что Gemini 3.5 Transcribe превосходит Chirp 3 благодаря меньшей задержке и более низкому Word Error Rate, включая сокращение времени до финальной транскрипции на 70%.
  • Google сообщила, что модель доступна в public preview для разработчиков, предприятий и пользователей в продуктах Google, включая Gemini app на macOS и Rambler на Android.
Google DeepMind представляет Gemini 3.5 Transcribe для распознавания речи в реальном времени

Google DeepMind представляет Gemini 3.5 Transcribe для распознавания речи в реальном времени

26 авг. 2026 г.

Диего Мелендо Касадо, Senior Director of Engineering, Gemini Audio, и Люк Леонхард, Chief of Staff, Gemini Audio, от имени команды Gemini Audio сообщили, что Google представляет Gemini 3.5 Transcribe — самую точную на сегодняшний день модель преобразования речи в текст, созданную для интеллектуальных голосовых взаимодействий.

По словам компании, Gemini 3.5 Transcribe отличается от традиционных систем распознавания речи, которым сложно работать при фоновом шуме, сложной терминологии и очистке от речевых неточностей. Google заявила, что модель напрямую преобразует исходное аудио в точный, отредактированный и форматированный текст, что важно для команд, создающих голосовые инструменты, которым нужен готовый к использованию результат без значительной постобработки.

Google сообщила, что потребители уже используют модель транскрибации в таких продуктах, как Gemini app и Android, включая новые голосовые возможности, такие как Rambler на Android и в Gemini app на macOS. Теперь разработчики могут создавать аналогичные возможности с Gemini 3.5 Transcribe через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform.

Модель создана так, чтобы вписываться в рабочие процессы для голосовых агентов, инструментов субтитрирования в реальном времени и аналитических пайплайнов после звонков — в тех областях, где задержка, форматирование и атрибуция говорящего влияют на то, как быстро транскрипция может быть использована в работе. Google заявила, что модель доступна через два отдельных API:

  • Потоковая передача в реальном времени: Непрерывная двусторонняя потоковая передача с задержкой менее секунды для интерактивных голосовых приложений через Live API с использованием gemini-3.5-transcribe-live.
  • Обработка предварительно записанного аудио: Транскрибация записанного аудио, встреч, журналов звонков и другого контента с атрибуцией говорящего и временными метками на уровне слов через Interactions API с использованием gemini-3.5-transcribe.

Более точная и интеллектуальная транскрипция

Google заявила, что Gemini 3.5 Transcribe создана для распознавания естественного стиля речи, лучшего понимания намерений пользователя и распознавания пользовательской лексики, чтобы пользователи могли выполнять задачи с помощью голоса.

Компания выделила несколько возможностей:

  • Умная транскрипция: Корректно обрабатывает самокоррекции, например «let’s meet Tuesday—no, Wednesday», удаляет слова-паразиты, такие как «ums» и «ahs», и автоматически форматирует текст.
  • Function calling: Может передавать сложные задачи, такие как генерация изображений и анализ файлов, другим моделям Gemini через function calls. Google сообщила, что сейчас это доступно в приложении Gemini для macOS.
  • Более точная транскрипция: Согласно оценке Artificial Analysis, модель достигает среднего Word Error Rate (WER) на уровне 4.0% для потокового режима и 2.6% для сценариев без потоковой передачи. Google заявила, что модель хорошо работает в шумных реальных условиях и точно распознает буквенно-цифровые сущности, такие как почтовые индексы и идентификаторы заказов.
  • Пользовательская лексика: Распознает специализированный жаргон и нестандартные написания, адаптируя транскрипцию к предоставленной пользователем пользовательской лексике.
  • Глобальная языковая поддержка: Автоматически определяет и транскрибирует более 85 языков, корректно обрабатывая региональные акценты и различные диалекты.
  • Определение нескольких говорящих: В предварительно записанном аудио точно атрибутирует речь с временными метками для до трех говорящих; поддержка более чем 3 говорящих является экспериментальной.

Google заявила, что Gemini 3.5 Transcribe справляется с переключением языков в ходе разговора и бесшовной потоковой транскрипцией. Компания также отметила, что модель представляет собой крупный шаг вперед по сравнению с предыдущей моделью транскрибации Chirp 3, предлагая новые возможности, более низкий Word Error Rate и значительно меньшую задержку. Согласно Artificial Analysis, время до финальной транскрипции, например, сокращается на 70%. По результатам бенчмарка FLEURS на наборе ведущих языков и локалей модель демонстрирует точную многоязычную работу, превосходя Chirp 3, и достигает WER 5.50% в потоковом режиме и 5.04% в сценариях без потоковой передачи.

Интеллектуальная транскрипция и расширенный диктант в продуктах Google

Помимо Gemini API в Google AI Studio и Gemini Enterprise Agent Platform, 3.5 Transcribe выходит за рамки стандартного speech-to-text, делая работу в экосистеме Google более естественной и интуитивной. Благодаря контекстному пониманию, встроенному напрямую в повседневные интерфейсы, такие как Gboard, Antigravity, Gemini app и Chrome, модель легко улавливает нюансы, намерения и встроенные правки.

В Gboard на Android новая функция Rambler использует 3.5 Transcribe, чтобы превращать устную речь в хорошо отформатированный текст, отфильтровывая слова-паразиты. Голосом также можно вносить правки, исправлять орфографические ошибки и менять стиль текста.

В Google Antigravity 3.5 Transcribe объединяет контекст экрана и историю чата, с вашего разрешения, чтобы обеспечить высокую точность транскрибации для имен файлов, мыслей агента и активных документов.

В Google AI Studio вы можете получить доступ к 3.5 Transcribe в режиме Build, чтобы создавать приложения с голосовым вводом на лету.

В приложении Gemini на macOS 3.5 Transcribe не только преобразует свободную естественную речь в чистый, отформатированный текст, но и поддерживает голосовые команды, которые могут бесшовно сочетаться с контекстом экрана для сложных рабочих процессов. Вызывая другие модели Gemini в фоновом режиме для выполнения тяжелых задач, модель позволяет без усилий суммировать локальные файлы, переиспользовать текст между приложениями или генерировать изображения прямо у курсора — только с помощью голоса.

В ближайшее время в Chrome вы сможете диктовать текст в любом веб-поле — это упростит ответы, черновики постов или обращение к Gemini в Chrome более естественным и удобным голосом.

Gemini 3.5 Transcribe позволяет анализировать файлы, генерировать изображения и выполнять поиск в приложении Gemini на macOS, используя только голос.

Посмотрите, как Gemini 3.5 Transcribe использует Rambler на Android, чтобы автоматически удалять слова-паразиты и очищать речь.

Gemini 3.5 Transcribe использует контекст экрана в Google Antigravity, чтобы обеспечить точную транскрипцию.

Первые отзывы

Используя Gemini Live API, такие платформы для разработчиков, как Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents, позволяют разработчикам с легкостью создавать и разворачивать высокопроизводительные голосовые интерфейсы. Эти платформы управляют сложной инфраструктурой потоковой передачи мультимедиа в реальном времени в фоновом режиме, позволяя разработчикам полностью сосредоточиться на пользовательском опыте.

Компании Vivo, Intellitek Health и Lingopal также поделились положительными отзывами о 3.5 Transcribe, отметив впечатляющую задержку, точность и широкую языковую поддержку.

Начните использовать 3.5 Transcribe сегодня

Для разработчиков: в public preview в Gemini API через Google AI Studio и Google Antigravity.

Для предприятий: в public preview через Gemini Enterprise Agent Platform и в ближайшее время в Gemini Enterprise for Customer Experience.

Для всех: в Gemini app на macOS на английском языке, в Rambler на Android в отдельных странах и языках, а также скоро в Chrome.

Получайте последние новости от Google на свою почту

Подпишитесь на наши рассылки с обновлениями продуктов, информацией о мероприятиях, специальными предложениями и многим другим.

Готово. Остался один шаг.

Проверьте свою почту, чтобы подтвердить подписку.

Вы также можете подписаться с другим адресом электронной почты.

Ваша информация будет использоваться в соответствии с политикой конфиденциальности Google. Вы можете отказаться от подписки в любое время.

Похожие материалы

Что на самом деле означает «full-stack» AI?

Представляем Gemini 3.7 Flash

Эксперты Omni делятся тем, что их больше всего вдохновляет в этой модели.

Посмотрите, что создают 5 разработчиков с Gemini Omni

Последние новости об ИИ, которые мы объявили в июле 2026

Внутри нашего курса vibe coding для 353,000 человек