Google DeepMind présente Gemini 3.5 Transcribe pour la transcription vocale en temps réel
Points clés
- •Google a indiqué que Gemini 3.5 Transcribe est son modèle de conversion parole-texte le plus précis à ce jour et qu’il est conçu pour des flux de travail pilotés par la voix.
- •Le modèle propose une transcription en temps réel via la Live API et un traitement d’audio enregistré avec attribution des locuteurs et horodatage via l’Interactions API.
- •Google a indiqué que le modèle prend en charge plus de 85 langues, le vocabulaire personnalisé, les changements de langue en direct et l’identification de plusieurs locuteurs pour jusqu’à trois locuteurs dans l’audio préenregistré.
- •L’entreprise a déclaré que Gemini 3.5 Transcribe améliore Chirp 3 avec une latence plus faible et de meilleurs taux d’erreur, notamment un temps jusqu’à la transcription finale 70% plus rapide.
- •Google a indiqué que le modèle est disponible en avant-première publique pour les développeurs, les entreprises et les consommateurs sur plusieurs produits Google, dont l’application Gemini sur macOS et Rambler sur Android.

Google DeepMind présente Gemini 3.5 Transcribe pour la transcription vocale en temps réel
26 août 2026
Diego Melendo Casado, Senior Director of Engineering, Gemini Audio, et Luke Leonhard, Chief of Staff, Gemini Audio, au nom de l’équipe Gemini Audio, ont indiqué que Google présente Gemini 3.5 Transcribe, son modèle de conversion parole-texte le plus précis à ce jour, conçu pour des interactions vocales intelligentes.
Selon l’entreprise, Gemini 3.5 Transcribe se distingue des systèmes de reconnaissance vocale conventionnels qui peuvent avoir des difficultés avec le bruit de fond, le jargon complexe et la correction des disfluences. Google a indiqué que le modèle convertit l’audio brut directement en texte précis, soigné et formaté, ce qui est important pour les équipes qui développent des outils vocaux nécessitant une sortie exploitable sans post-traitement lourd.
Google a indiqué que les consommateurs utilisent déjà le modèle de transcription dans des produits tels que l’application Gemini et Android, y compris de nouvelles fonctionnalités vocales comme Rambler sur Android et dans l’application Gemini sur macOS. Les développeurs peuvent désormais créer des capacités similaires avec Gemini 3.5 Transcribe via l’API Gemini dans Google AI Studio et la Gemini Enterprise Agent Platform.
Le modèle est conçu pour s’intégrer à des flux de travail destinés aux agents vocaux, aux outils de sous-titrage en temps réel et aux pipelines d’analyse post-appel, des domaines où la latence, le formatage et l’attribution des locuteurs peuvent influencer la rapidité avec laquelle la transcription est exploitable. Google a indiqué qu’il est disponible via deux API distinctes :
- Diffusion en temps réel : diffusion continue bidirectionnelle avec une latence inférieure à la seconde pour les applications vocales interactives via la Live API en utilisant
gemini-3.5-transcribe-live. - Traitement d’audio préenregistré : transcription d’audios enregistrés, de réunions, de journaux d’appels et plus encore, avec attribution des locuteurs et horodatage au niveau du mot via l’Interactions API en utilisant
gemini-3.5-transcribe.
Fonctionnalités et performances
Google a indiqué que Gemini 3.5 Transcribe est conçu pour capturer le style d’élocution naturel, comprendre l’intention de l’utilisateur et reconnaître un vocabulaire personnalisé afin que les utilisateurs puissent exécuter des tâches à la voix.
L’entreprise a mis en avant plusieurs capacités :
- Transcription intelligente : gère de manière fluide les auto-corrections, comme “let’s meet Tuesday—no, Wednesday”, supprime les mots de remplissage tels que “ums” et “ahs”, et met automatiquement le texte en forme.
- Appel de fonctions : peut déléguer des tâches complexes, telles que la génération d’images et l’analyse de fichiers, à d’autres modèles Gemini via des appels de fonction. Google a indiqué que cela est actuellement disponible dans l’application Gemini sur macOS.
- Transcription plus précise : selon les mesures d’Artificial Analysis, le modèle atteint un Word Error Rate moyen de 4,0% en streaming et de 2,6% en non-streaming. Google a indiqué qu’il affiche de solides performances dans des environnements réels bruyants et qu’il peut capturer avec précision des entités alphanumériques telles que des codes postaux et des identifiants de commande.
- Vocabulaire personnalisé : reconnaît le jargon spécialisé et les orthographes uniques en adaptant de manière fluide les transcriptions au vocabulaire personnalisé fourni par l’utilisateur.
- Prise en charge globale des langues : détecte et transcrit automatiquement plus de 85 langues, en gérant de manière fluide les accents régionaux et les dialectes divers.
- Identification de plusieurs locuteurs : dans l’audio préenregistré, il peut attribuer la parole avec des horodatages pour jusqu’à trois locuteurs (la prise en charge de plus de 3 locuteurs est expérimentale).
Google a indiqué que Gemini 3.5 Transcribe peut gérer les changements de langue en direct et la transcription en continu sans interruption. L’entreprise a également déclaré que le modèle représente une avancée majeure par rapport à son précédent modèle de transcription, Chirp 3, avec de nouvelles capacités, de meilleurs taux d’erreur et une latence nettement améliorée. Selon les mesures d’Artificial Analysis, le temps jusqu’à la transcription finale s’améliore par exemple de 70%. Sur le benchmark FLEURS, sur un ensemble de langues et de régions de premier plan, le modèle affiche des performances multilingues précises, en améliorant les résultats de Chirp 3, et atteint un WER de 5,50% en mode streaming et de 5,04% en non-streaming.
Transcription intelligente dans les produits Google
Google a indiqué que Gemini 3.5 Transcribe va au-delà de la simple conversion parole-texte dans les produits Google en ajoutant une compréhension contextuelle à des surfaces comme Gboard, Antigravity, l’application Gemini et Chrome.
Sur Gboard sur Android, la nouvelle fonctionnalité Rambler utilise Gemini 3.5 Transcribe pour transformer des pensées formulées oralement en texte bien formaté, tout en filtrant les mots de remplissage. Les utilisateurs peuvent aussi utiliser la voix pour effectuer des modifications, corriger des fautes d’orthographe et changer le style d’écriture.
Dans Google Antigravity, le modèle associe le contexte à l’écran et l’historique des conversations, avec votre autorisation, afin d’améliorer la précision de la transcription pour les noms de fichiers, les réflexions de l’agent et les documents actifs.
Dans Google AI Studio, les utilisateurs peuvent accéder à Gemini 3.5 Transcribe en mode Build pour créer des applications à la voix, à la volée.
Dans l’application Gemini sur macOS, le modèle transcrit non seulement la parole naturelle en texte propre et formaté, mais permet aussi des commandes vocales qui peuvent s’appuyer de manière fluide sur le contexte à l’écran pour alimenter des workflows complexes. En sollicitant d’autres modèles Gemini en arrière-plan pour gérer les tâches lourdes, le modèle facilite la synthèse de fichiers locaux, la réutilisation de texte entre applications ou la génération d’images directement au niveau du curseur — en utilisant uniquement la voix.
Bientôt disponible dans Chrome, vous pourrez parler pour saisir du texte dans n’importe quel champ web, ce qui facilitera la dictée de réponses, la rédaction de publications ou l’interaction avec Gemini dans Chrome de manière plus naturelle et plus simple à la voix.
Gemini 3.5 Transcribe permet d’analyser des fichiers, de générer des images et d’effectuer des recherches dans l’application Gemini sur macOS en utilisant uniquement la voix.
Découvrez comment Gemini 3.5 Transcribe utilise Rambler sur Android pour supprimer automatiquement les mots de remplissage et nettoyer la parole.
Gemini 3.5 Transcribe exploite le contexte à l’écran dans Google Antigravity pour garantir une transcription précise.
Lire les premiers retours
En s’appuyant sur la Gemini Live API, des plateformes pour développeurs telles qu’Agora , Fishjam , LangChain , LiveKit , Pipecat , Vercel et Vision Agents permettent aux développeurs de créer et de déployer facilement des interfaces vocales hautes performances. Ces plateformes gèrent en arrière-plan une infrastructure complexe de diffusion multimédia en temps réel, permettant aux développeurs de se concentrer entièrement sur la conception de l’expérience utilisateur.
Des entreprises comme Vivo, Intellitek Health et Lingopal ont également partagé des retours positifs sur 3.5 Transcribe, soulignant sa latence, sa précision et sa prise en charge étendue des langues.
Commencez à utiliser 3.5 Transcribe dès aujourd’hui
Pour les développeurs : en avant-première publique dans l’API Gemini via Google AI Studio et Google Antigravity.
Pour les entreprises : en avant-première publique via Gemini Enterprise Agent Platform et bientôt dans Gemini Enterprise for Customer Experience.
Pour tous : dans l’application Gemini sur macOS en anglais, dans Rambler sur Android dans certains pays et langues, et bientôt dans Chrome.
Recevez les dernières actualités de Google dans votre boîte de réception
Inscrivez-vous à nos newsletters pour recevoir des mises à jour produits, des informations sur les événements, des offres spéciales et plus encore.
C’est fait. Encore une étape.
Vérifiez votre boîte de réception pour confirmer votre abonnement.
Vous pouvez aussi vous abonner avec une autre adresse e-mail.
Vos informations seront utilisées conformément à la politique de confidentialité de Google. Vous pouvez vous désinscrire à tout moment.