NoticiasAccionesGoogle DeepMind presenta Gemini 3.5 Transcribe para transcripción de voz a texto en tiempo real

Google DeepMind presenta Gemini 3.5 Transcribe para transcripción de voz a texto en tiempo real

Autor: Google DeepMind Blog·

Puntos clave

  • Google dijo que Gemini 3.5 Transcribe es su modelo de voz a texto más preciso hasta ahora y que está diseñado para flujos de trabajo impulsados por voz.
  • El modelo ofrece transcripción en streaming en tiempo real mediante la Live API y procesamiento de audio grabado con atribución por hablante y marcas de tiempo mediante la Interactions API.
  • Google dijo que el modelo admite más de 85 idiomas, vocabulario personalizado, cambios de idioma en vivo e identificación de varios hablantes para hasta tres hablantes en audio pregrabado.
  • La compañía afirmó que Gemini 3.5 Transcribe mejora a Chirp 3 con menor latencia y mejores tasas de error de palabras, incluido un 70% más rápido hasta la transcripción final.
  • Google dijo que el modelo está disponible en vista previa pública para desarrolladores, empresas y consumidores en productos de Google, incluida la app Gemini en macOS y Rambler en Android.
Google DeepMind presenta Gemini 3.5 Transcribe para transcripción de voz a texto en tiempo real

Google DeepMind presenta Gemini 3.5 Transcribe para voz a texto en tiempo real

26 ago. 2026

Diego Melendo Casado, Senior Director of Engineering, Gemini Audio, y Luke Leonhard, Chief of Staff, Gemini Audio, en nombre del equipo de Gemini Audio, señalaron que Google presenta Gemini 3.5 Transcribe, su modelo de voz a texto más preciso hasta la fecha, diseñado para interacciones de voz inteligentes.

Según la compañía, Gemini 3.5 Transcribe se diferencia de los sistemas convencionales de reconocimiento de voz, que pueden tener dificultades con el ruido de fondo, la jerga compleja y la limpieza de disfluencias. Google afirmó que el modelo convierte el audio sin procesar directamente en texto preciso, pulido y con formato, algo importante para los equipos que desarrollan herramientas de voz y necesitan resultados utilizables sin un posprocesamiento intenso.

Google dijo que los usuarios ya están utilizando el modelo de transcripción en productos como la app Gemini y Android, incluidas nuevas capacidades de voz como Rambler en Android y en la app Gemini en macOS. Ahora, los desarrolladores pueden crear capacidades similares con Gemini 3.5 Transcribe a través de la Gemini API en Google AI Studio y Gemini Enterprise Agent Platform.

El modelo está diseñado para integrarse en flujos de trabajo de agentes de voz, herramientas de subtitulado en tiempo real y canalizaciones de analítica posterior a llamadas, áreas en las que la latencia, el formato y la atribución por hablante pueden afectar la rapidez con la que la transcripción se convierte en acción. Google dijo que está disponible a través de dos APIs separadas:

  • Streaming en tiempo real: ofrece streaming continuo y bidireccional con latencia inferior al segundo para aplicaciones de voz interactivas mediante la Live API usando gemini-3.5-transcribe-live.
  • Procesamiento de audio pregrabado: transcribe audio grabado, reuniones, registros de llamadas y más con atribución por hablante y marcas de tiempo a nivel de palabra mediante la Interactions API usando gemini-3.5-transcribe.

Más precisión e inteligencia en la transcripción

Google dijo que Gemini 3.5 Transcribe está diseñado para captar el estilo natural de habla, comprender la intención del usuario y reconocer vocabulario personalizado, de modo que los usuarios puedan ejecutar tareas con la voz.

La compañía destacó varias capacidades:

  • Transcripción inteligente: maneja sin problemas autocorrecciones, como “let’s meet Tuesday—no, Wednesday”, elimina palabras de relleno como “ums” y “ahs”, y da formato automático al texto.
  • Llamadas a funciones: el modelo puede delegar tareas complejas, como la generación de imágenes y el análisis de archivos, a otros modelos de Gemini mediante function calls. Google dijo que actualmente está disponible en la app Gemini para macOS.
  • Transcripción más precisa: según Artificial Analysis, alcanza una Word Error Rate (WER) promedio de 4.0% para streaming y 2.6% para casos de uso sin streaming. Muestra un buen rendimiento en entornos reales y ruidosos, capturando con precisión entidades alfanuméricas como códigos postales e IDs de pedido.
  • Vocabulario personalizado: reconoce jerga especializada y grafías únicas adaptando las transcripciones al vocabulario personalizado proporcionado por el usuario.
  • Soporte global de idiomas: detecta y transcribe automáticamente más de 85 idiomas, manejando sin problemas acentos regionales y dialectos diversos.
  • Identificación de varios hablantes: en audio pregrabado, atribuye el discurso con marcas de tiempo para hasta tres hablantes (el soporte para más de 3 hablantes es experimental).

Gemini 3.5 Transcribe maneja cambios de idioma en vivo y una transcripción continua sin interrupciones.

Vea cómo Gemini 3.5 Transcribe limpia las disfluencias del habla con capacidades de transcripción inteligente.

3.5 Transcribe ofrece transcripción con atribución de varios hablantes y marcas de tiempo a nivel de palabra.

El rendimiento de Gemini 3.5 Transcribe representa un avance importante frente a nuestro modelo de transcripción anterior, Chirp 3, con nuevas capacidades, mejores tasas de error de palabras y una latencia significativamente mejor. Según Artificial Analysis, el tiempo hasta la transcripción final, por ejemplo, mejora en 70%. En el benchmark FLEURS, en un conjunto de idiomas y configuraciones locales destacados, el modelo ofrece un rendimiento multilingüe preciso, mejorando respecto a Chirp 3, y logra una WER de 5.50% en modo streaming y 5.04% en casos de uso sin streaming.

Experiencia de transcripción inteligente y dictado avanzado

Además de la Gemini API en Google AI Studio y Gemini Enterprise Agent Platform, 3.5 Transcribe va más allá de la conversión estándar de voz a texto para hacer que trabajar en Google sea más natural e intuitivo. Al incorporar comprensión contextual directamente en superficies cotidianas como Gboard, Antigravity, la app Gemini y Chrome, capta matices, intención y ediciones en línea con facilidad.

En Gboard en Android, mediante la nueva función Rambler, 3.5 Transcribe transforma pensamientos hablados en texto bien formateado, filtrando palabras de relleno. También puede usar la voz para hacer ediciones, corregir errores ortográficos y cambiar el estilo de escritura.

En Google Antigravity, 3.5 Transcribe combina el contexto de pantalla y el historial de chat, con su permiso, para garantizar una precisión de transcripción muy alta en nombres de archivos, pensamientos del agente y documentos activos.

En Google AI Studio, puede acceder a 3.5 Transcribe en modo Build para crear aplicaciones con la voz sobre la marcha.

En la app Gemini para macOS, 3.5 Transcribe no solo transcribe su habla natural y libre en texto limpio y con formato, sino que también habilita comandos de voz que pueden combinarse sin problemas con el contexto de pantalla para impulsar flujos de trabajo complejos. Al recurrir a otros modelos de Gemini en segundo plano para encargarse del trabajo pesado, el modelo facilita resumir archivos locales, reutilizar texto entre aplicaciones o generar imágenes justo en el cursor, usando solo la voz.

Próximamente en Chrome, podrá hablar para escribir en cualquier campo web, lo que facilitará dictar respuestas, redactar publicaciones o pedirle cosas a Gemini en Chrome de forma más natural y sencilla con la voz.

Gemini 3.5 Transcribe le permite analizar archivos, generar imágenes y buscar en la app Gemini para macOS usando solo la voz.

Vea cómo Gemini 3.5 Transcribe usa Rambler en Android para eliminar automáticamente palabras de relleno y limpiar el habla.

Gemini 3.5 Transcribe aprovecha el contexto de pantalla en Google Antigravity para garantizar una transcripción precisa.

Lea las primeras reseñas

Al aprovechar la Gemini Live API, plataformas para desarrolladores como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents permiten a los desarrolladores crear e implementar con facilidad interfaces de alto rendimiento impulsadas por voz. Estas plataformas gestionan detrás de escena la infraestructura compleja de streaming de medios en tiempo real, lo que permite a los desarrolladores concentrarse por completo en diseñar la experiencia de usuario.

Empresas como Vivo, Intellitek Health y Lingopal también han compartido comentarios positivos sobre 3.5 Transcribe, destacando su latencia, precisión y amplia compatibilidad con idiomas.

Empiece a usar 3.5 Transcribe hoy

Para desarrolladores: en vista previa pública en la Gemini API a través de Google AI Studio y Google Antigravity.

Para empresas: en vista previa pública a través de Gemini Enterprise Agent Platform y próximamente en Gemini Enterprise for Customer Experience.

Para todos: en la app Gemini para macOS en inglés, en Rambler en Android en países e idiomas seleccionados, y próximamente en Chrome.

Reciba las últimas noticias de Google en su correo

Suscríbase a nuestros boletines con actualizaciones de productos, información de eventos, ofertas especiales y más.

Listo. Solo falta un paso más.

Revise su correo para confirmar su suscripción.

También puede suscribirse con una dirección de correo diferente.

Su información se usará de acuerdo con la política de privacidad de Google. Puede darse de baja en cualquier momento.

Historias relacionadas

¿Qué significa realmente la IA de “full stack”?

Presentamos Gemini 3.7 Flash

Expertos de Omni comparten qué es lo que más les entusiasma del modelo.

Vea lo que 5 desarrolladores están creando con Gemini Omni

Las últimas noticias de IA que anunciamos en julio de 2026

Dentro de nuestro curso de vibe coding de 353,000 personas