Google DeepMind представляет Gemini 3.5 Transcribe для распознавания речи в реальном времени
Ключевые выводы
- •Google заявила, что Gemini 3.5 Transcribe — самая точная на сегодня модель преобразования речи в текст, созданная для рабочих процессов с голосовым управлением.
- •Модель предлагает потоковую транскрибацию в реальном времени через Live API и обработку записанного аудио с атрибуцией говорящего и временными метками через Interactions API.
- •Google сообщила, что модель поддерживает более 85 языков, пользовательскую лексику, переключение языков в ходе разговора и определение нескольких говорящих для до трех участников в предварительно записанном аудио.
- •Компания заявила, что Gemini 3.5 Transcribe превосходит Chirp 3 благодаря меньшей задержке и более низкому Word Error Rate, включая сокращение времени до финальной транскрипции на 70%.
- •Google сообщила, что модель доступна в public preview для разработчиков, предприятий и пользователей в продуктах Google, включая Gemini app на macOS и Rambler на Android.

Google DeepMind представляет Gemini 3.5 Transcribe для распознавания речи в реальном времени
26 авг. 2026 г.
Диего Мелендо Касадо, Senior Director of Engineering, Gemini Audio, и Люк Леонхард, Chief of Staff, Gemini Audio, от имени команды Gemini Audio сообщили, что Google представляет Gemini 3.5 Transcribe — самую точную на сегодняшний день модель преобразования речи в текст, созданную для интеллектуальных голосовых взаимодействий.
По словам компании, Gemini 3.5 Transcribe отличается от традиционных систем распознавания речи, которым сложно работать при фоновом шуме, сложной терминологии и очистке от речевых неточностей. Google заявила, что модель напрямую преобразует исходное аудио в точный, отредактированный и форматированный текст, что важно для команд, создающих голосовые инструменты, которым нужен готовый к использованию результат без значительной постобработки.
Google сообщила, что потребители уже используют модель транскрибации в таких продуктах, как Gemini app и Android, включая новые голосовые возможности, такие как Rambler на Android и в Gemini app на macOS. Теперь разработчики могут создавать аналогичные возможности с Gemini 3.5 Transcribe через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform.
Модель создана так, чтобы вписываться в рабочие процессы для голосовых агентов, инструментов субтитрирования в реальном времени и аналитических пайплайнов после звонков — в тех областях, где задержка, форматирование и атрибуция говорящего влияют на то, как быстро транскрипция может быть использована в работе. Google заявила, что модель доступна через два отдельных API:
- Потоковая передача в реальном времени: Непрерывная двусторонняя потоковая передача с задержкой менее секунды для интерактивных голосовых приложений через Live API с использованием
gemini-3.5-transcribe-live. - Обработка предварительно записанного аудио: Транскрибация записанного аудио, встреч, журналов звонков и другого контента с атрибуцией говорящего и временными метками на уровне слов через Interactions API с использованием
gemini-3.5-transcribe.
Более точная и интеллектуальная транскрипция
Google заявила, что Gemini 3.5 Transcribe создана для распознавания естественного стиля речи, лучшего понимания намерений пользователя и распознавания пользовательской лексики, чтобы пользователи могли выполнять задачи с помощью голоса.
Компания выделила несколько возможностей:
- Умная транскрипция: Корректно обрабатывает самокоррекции, например «let’s meet Tuesday—no, Wednesday», удаляет слова-паразиты, такие как «ums» и «ahs», и автоматически форматирует текст.
- Function calling: Может передавать сложные задачи, такие как генерация изображений и анализ файлов, другим моделям Gemini через function calls. Google сообщила, что сейчас это доступно в приложении Gemini для macOS.
- Более точная транскрипция: Согласно оценке Artificial Analysis, модель достигает среднего Word Error Rate (WER) на уровне 4.0% для потокового режима и 2.6% для сценариев без потоковой передачи. Google заявила, что модель хорошо работает в шумных реальных условиях и точно распознает буквенно-цифровые сущности, такие как почтовые индексы и идентификаторы заказов.
- Пользовательская лексика: Распознает специализированный жаргон и нестандартные написания, адаптируя транскрипцию к предоставленной пользователем пользовательской лексике.
- Глобальная языковая поддержка: Автоматически определяет и транскрибирует более 85 языков, корректно обрабатывая региональные акценты и различные диалекты.
- Определение нескольких говорящих: В предварительно записанном аудио точно атрибутирует речь с временными метками для до трех говорящих; поддержка более чем 3 говорящих является экспериментальной.
Google заявила, что Gemini 3.5 Transcribe справляется с переключением языков в ходе разговора и бесшовной потоковой транскрипцией. Компания также отметила, что модель представляет собой крупный шаг вперед по сравнению с предыдущей моделью транскрибации Chirp 3, предлагая новые возможности, более низкий Word Error Rate и значительно меньшую задержку. Согласно Artificial Analysis, время до финальной транскрипции, например, сокращается на 70%. По результатам бенчмарка FLEURS на наборе ведущих языков и локалей модель демонстрирует точную многоязычную работу, превосходя Chirp 3, и достигает WER 5.50% в потоковом режиме и 5.04% в сценариях без потоковой передачи.
Интеллектуальная транскрипция и расширенный диктант в продуктах Google
Помимо Gemini API в Google AI Studio и Gemini Enterprise Agent Platform, 3.5 Transcribe выходит за рамки стандартного speech-to-text, делая работу в экосистеме Google более естественной и интуитивной. Благодаря контекстному пониманию, встроенному напрямую в повседневные интерфейсы, такие как Gboard, Antigravity, Gemini app и Chrome, модель легко улавливает нюансы, намерения и встроенные правки.
В Gboard на Android новая функция Rambler использует 3.5 Transcribe, чтобы превращать устную речь в хорошо отформатированный текст, отфильтровывая слова-паразиты. Голосом также можно вносить правки, исправлять орфографические ошибки и менять стиль текста.
В Google Antigravity 3.5 Transcribe объединяет контекст экрана и историю чата, с вашего разрешения, чтобы обеспечить высокую точность транскрибации для имен файлов, мыслей агента и активных документов.
В Google AI Studio вы можете получить доступ к 3.5 Transcribe в режиме Build, чтобы создавать приложения с голосовым вводом на лету.
В приложении Gemini на macOS 3.5 Transcribe не только преобразует свободную естественную речь в чистый, отформатированный текст, но и поддерживает голосовые команды, которые могут бесшовно сочетаться с контекстом экрана для сложных рабочих процессов. Вызывая другие модели Gemini в фоновом режиме для выполнения тяжелых задач, модель позволяет без усилий суммировать локальные файлы, переиспользовать текст между приложениями или генерировать изображения прямо у курсора — только с помощью голоса.
В ближайшее время в Chrome вы сможете диктовать текст в любом веб-поле — это упростит ответы, черновики постов или обращение к Gemini в Chrome более естественным и удобным голосом.
Gemini 3.5 Transcribe позволяет анализировать файлы, генерировать изображения и выполнять поиск в приложении Gemini на macOS, используя только голос.
Посмотрите, как Gemini 3.5 Transcribe использует Rambler на Android, чтобы автоматически удалять слова-паразиты и очищать речь.
Gemini 3.5 Transcribe использует контекст экрана в Google Antigravity, чтобы обеспечить точную транскрипцию.
Первые отзывы
Используя Gemini Live API, такие платформы для разработчиков, как Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents, позволяют разработчикам с легкостью создавать и разворачивать высокопроизводительные голосовые интерфейсы. Эти платформы управляют сложной инфраструктурой потоковой передачи мультимедиа в реальном времени в фоновом режиме, позволяя разработчикам полностью сосредоточиться на пользовательском опыте.
Компании Vivo, Intellitek Health и Lingopal также поделились положительными отзывами о 3.5 Transcribe, отметив впечатляющую задержку, точность и широкую языковую поддержку.
Начните использовать 3.5 Transcribe сегодня
Для разработчиков: в public preview в Gemini API через Google AI Studio и Google Antigravity.
Для предприятий: в public preview через Gemini Enterprise Agent Platform и в ближайшее время в Gemini Enterprise for Customer Experience.
Для всех: в Gemini app на macOS на английском языке, в Rambler на Android в отдельных странах и языках, а также скоро в Chrome.
Получайте последние новости от Google на свою почту
Подпишитесь на наши рассылки с обновлениями продуктов, информацией о мероприятиях, специальными предложениями и многим другим.
Готово. Остался один шаг.
Проверьте свою почту, чтобы подтвердить подписку.
Вы также можете подписаться с другим адресом электронной почты.
Ваша информация будет использоваться в соответствии с политикой конфиденциальности Google. Вы можете отказаться от подписки в любое время.