Google DeepMind lance Gemini 3.8 Flash TTS et Flash-Lite TTS, ses modèles de synthèse vocale les plus expressifs à ce jour
Points clés
- •Google DeepMind a lancé deux modèles de synthèse vocale : Gemini 3.8 Flash TTS, conçu pour la conception expressive de personnages et la mise en scène, et Gemini 3.8 Flash-Lite TTS, conçu pour une génération vocale à fort volume et à coût maîtrisé.
- •Les utilisateurs peuvent concevoir des voix originales via des prompts en langage naturel, choisir parmi une bibliothèque de plus de 2 000 voix prêtes pour la production couvrant plus de 100 langues et dialectes, et répliquer une voix à partir d'un échantillon audio de 30 secondes.
- •Les deux modèles offrent un contrôle ligne par ligne du rythme, de l'émotion, des indices non verbaux et de la mise en scène à deux voix, et peuvent générer des heures d'audio continu avec une dérive minimale des voix.
- •Google indique que Gemini 3.8 Flash TTS s'est classé premier au Voice Design Benchmark de Hume AI avec un score de 71,4, et que les deux modèles ont occupé les deux premières places de l' Quality Index de Hume AI.
- •La réplication de voix nécessite le consentement vérifié du propriétaire de la voix, tout l'audio généré porte un filigrane SynthID, et la réplication via AI Studio n'est pas disponible dans certaines régions, dont l'Illinois, le Texas, l'EEE, le Royaume-Uni, la Suisse et l'Inde.

Google DeepMind a annoncé le 23 septembre 2026 la sortie de 3.8 Flash TTS et de Gemini 3.8 Flash-Lite TTS, deux modèles de synthèse vocale que l'entreprise présente comme ses modèles de génération audio les plus expressifs à ce jour. Ces modèles génèrent des voix de personnages personnalisées et des dialogues de scène entièrement mis en scène, et se déploient sur Google AI Studio, l'API Gemini, Gemini Enterprise, Gemini Notebook et Google Vids. La synthèse vocale est devenue un domaine en pleine expansion de l'IA générative, portée par la production de livres audio, le jeu vidéo, le doublage et les agents vocaux en temps réel, qui stimulent tous la demande pour une voix synthétique au rendu convaincamment humain.
L'annonce, publiée sur le blog de Google DeepMind, a été rédigée par Leland Rechis, Group Product Manager, et Alan Cowen, Director of Research Science, au nom de l'équipe Gemini Audio.
Dans son résumé, Google indique que les utilisateurs peuvent créer des voix personnalisées de toutes pièces ou répliquer des voix existantes à l'aide de simples prompts en langage naturel, diriger leur audio ligne par ligne pour contrôler le rythme, l'émotion et même les sons conversationnels réalistes, et utiliser ces modèles pour des livres audio, des podcasts ou des agents vocaux en temps réel de haute qualité, à grande échelle. Des outils de sécurité intégrés, notamment le filigranage, sont inclus pour contribuer à protéger l'audio généré.
Deux modèles pour des usages différents
Google présente ce lancement comme une transformation de la génération vocale, passant « de presets statiques à un véritable studio créatif dynamique », permettant aux créateurs, aux développeurs et aux entreprises de concevoir des expériences audio plus riches et plus expressives. L'entreprise ajoute que les modèles améliorent également l'expérience utilisateur de ses propres produits, notamment Gemini Notebook et Google Vids.
Gemini 3.8 Flash TTS est conçu pour la direction créative approfondie et la conception de personnages. Il peut créer des voix entièrement nouvelles à partir de prompts en langage naturel afin de donner vie à des personnages dans le jeu vidéo, les livres audio immersifs, les podcasts et les médias interactifs. Les utilisateurs peuvent diriger chaque performance ligne par ligne, avec un contrôle granulaire sur les indications de jeu, le rythme, les changements de dialecte et les réactions d'écoute.
Gemini 3.8 Flash-Lite TTS est conçu pour une mise à l'échelle à fort volume et à coût maîtrisé. Google indique qu'il est optimisé pour le doublage à grande échelle, la création de contenu audio et les agents vocaux expressifs, avec un contrôle fin du ton, du rythme et des nuances expressives. La répartition Flash / Flash-Lite suit la convention de nommage que Google applique déjà à famille Gemini, où les variantes Lite constituent des options plus légères et axées sur les coûts pour les charges de travail à haut débit.
Ces deux modèles complètent une famille Gemini Audio en forte croissance, qui comprenait auparavant 3.5 Live Translate, 3.5 Transcribe, 3.8 Live et 3.8 Live Extended Thinking.
Créer et personnaliser vos propres voix
Avec ces nouveaux modèles, Google passe de 30 voix d'origine à ce qu'il appelle une bibliothèque infinie. Que l'objectif soit une voix de personnage entièrement originale ou un ambassadeur de marque cohérent, l'entreprise affirme que Gemini 3.8 Flash TTS constitue un véritable studio vocal, permettant aux utilisateurs de créer et de déployer des voix expressives et au son naturel pour chaque usage, tandis que les développeurs et les entreprises construisent par-dessus des expériences audio personnalisées.
Les capacités de création vocale annoncées aujourd'hui comprennent :
Conception de voix générative. Les utilisateurs peuvent créer des voix sur mesure de toutes pièces avec Gemini 3.8 Flash TTS en personnalisant le rôle, l'accent et les caractéristiques vocales dans plus de 100 langues et dialectes via des prompts en langage naturel — que ce soit, selon les exemples de Google, pour donner vie à un dragon spectaculaire crachant du feu ou pour créer un narrateur charismatique avec une cadence régionale marquée. Les extraits de démonstration publiés avec l'article montrent le modèle générant une voix de DJ énergique de Melbourne, une voix de robot monocorde très métallique et un dragon japonais.
Bibliothèque de voix étendue. La plateforme propose plus de 2 000 voix prêtes pour la production avec une large couverture linguistique, incluant des variétés régionales telles que l'espagnol du Mexique, le français du Québec et l'anglais écossais.
Réplication de voix. Les utilisateurs peuvent recréer des profils vocaux cohérents à partir d'un simple échantillon audio de 30 secondes de leur propre voix, ou d'une voix dont ils détiennent les droits. Cette fonctionnalité s'appuie sur une vérification de consentement intégrée, le filigranage SynthID et les identifiants C2PA — un standard industriel ouvert permettant d'enregistrer la provenance d'un média et la manière dont il a été produit — afin de protéger à la fois les développeurs et leurs talents vocaux.
Enregistrer et déployer. Les voix personnalisées peuvent être enregistrées et gérées afin de garantir des performances cohérentes et une dérive minimale tout au long des projets en cours.
Remixage de voix. Bientôt disponible, les utilisateurs pourront choisir une voix dans la bibliothèque et affiner son timbre, sa hauteur, son rythme et son accent, en utilisant des prompts pour ajuster des caractéristiques telles que « ajouter un léger accent du sud des États-Unis » ou « adoucir le débit ».
Diriger la performance, ligne par ligne
Une fois les voix sélectionnées, les deux modèles TTS offrent un contrôle précis sur la manière dont chaque ligne est interprétée. Les utilisateurs peuvent écrire leurs propres indications scéniques ou laisser Gemini guider l'interprétation grâce à des indications de script naturelles — d'un agent de service client calme à une scène de suspense chuchotée. Les démonstrations de Google montrent le modèle alimentant des conversations naturelles et très expressives pour des agents vocaux interactifs, ainsi qu'un contrôle granulaire du script utilisé pour créer des expériences audio immersives et captivantes et des scènes de dialogue pleinement interprétées avec une alternance naturelle des tours de parole.
Les autres capacités de performance comprennent :
Génération longue durée.** Les modèles maintiennent une qualité vocale élevée, un rythme naturel et le timbre des personnages sur des heures d'audio continu avec une dérive minimale des voix, ce que Google présente comme idéal pour les podcasts et les livres audio.
Mise en scène native à deux voix. Les conversations à plusieurs tours peuvent être dirigées de manière transparente à partir d'un script unique — que ce soit pour un podcast ou une narration dramatique — tout en gardant les deux voix clairement distinctes grâce à une alternance conversationnelle naturelle des tours de parole.
Sons vocaux scriptés et réactions d'écoute. Les indices non verbaux tels que <laughs>, <sigh> et <gasp>, combinés aux interjections d'écoute active comme |mhm| ou |yeah|, ajoutent une texture conversationnelle réaliste pour un timing comique et des temps de réaction précis.
Benchmarks et portée multilingue
Google indique que Gemini 3.8 Flash TTS offre des capacités de personnalisation vocale de premier plan, obtenant la première place au classement général du Voice Design Benchmark de Hume AI, une évaluation tierce de l'entreprise de recherche en IA spécialisée dans la voix Hume AI, avec un score de 71,4, tout en menant également en modélisation des accents avec 60,8. L'entreprise ajoute que Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS permettent des performances expressives sans sacrifier la fiabilité, décrochant respectivement les première et deuxième places de l'Overall Quality Index de Hume AI.
Par rapport à Gemini 3.1 Flash TTS, Google indique que le nouveau modèle montre des améliorations majeures sur un large éventail de cas d'usage, notamment le contenu long et le contrôle de scénarios à deux voix.
Dans les évaluations de préférence humaine en aveugle sur Voice Arena, où les auditeurs comparent des échantillons anonymisés sans savoir quel modèle les a produits, Gemini 3.8 Flash et Flash-Lite TTS ont obtenu les premières positions parmi les concurrents dans des langues clés à l'échelle mondiale, dont le japonais, le portugais brésilien, le vietnamien, l'arabe standard moderne (MSA), l'espagnol du Mexique et le hindi. Avec la prise en charge de plus de 100 langues, l'entreprise affirme que ces modèles permettent aux créateurs, aux développeurs et aux entreprises de créer des expériences vocales multilingues de haute qualité dans le monde entier.
Sécurité, consentement et transparence
Google déclare avoir construit les capacités de création et de réplication vocale avec des garanties strictes afin de protéger les talents vocaux, de respecter l'identité et d'assurer la transparence des contenus. Pour la réplication de voix, le système s'appuie sur une vérification du consentement : les utilisateurs doivent fournir un enregistrement verbal de consentement du propriétaire de la voix correspondant au locuteur de référence avant qu'une voix puisse être créée. Ces garanties répondent à l'un des risques les plus surveillés de l'audio génératif : l'utilisation abusive de voix clonées à des fins d'usurpation d'identité et de fraude, ce qui a fait des flux de consentement et de vérification un point central des débats sur les politiques d'IA.
largement, chaque clip audio généré par les modèles Gemini Audio est filigrané avec SynthID, la technologie de filigranage de DeepMind permettant d'identifier les contenus générés par l'IA. Google décrit ce filigrane comme imperceptible et tissé directement dans la sortie audio, maintenant la parole générée par l'IA détectable afin de contribuer à prévenir la désinformation. Des détails supplémentaires sur l'approche de l'entreprise en matière de sécurité et de responsabilité sont disponibles dans la fiche modèle audio de Gemini 3.8.
Google signale également une restriction régionale : la réplication de voix via AI Studio n'est pas disponible dans l'Illinois, au Texas, dans l'Espace économique européen (EEE), au Royaume-Uni, en Suisse et en Inde.
Un espace de conception vocale dans Google AI Studio
À partir d'aujourd'hui, les développeurs peuvent essayer ces nouvelles capacités de génération vocale dans Google AI Studio. Conçu comme un espace de conception vocale, l'outil permet aux utilisateurs de générer de toutes pièces des identités vocales entièrement nouvelles ou de répliquer leur propre voix, puis de les intégrer directement dans un éditeur de scénario à deux voix pour diriger l'interprétation ligne par ligne.
Plateformes développeurs et partenaires de lancement
Via l'API Gemini, les plateformes de développement telles qu'Agora, LiveKit, Pipecat et Vercel — un ensemble couvrant l'infrastructure de communication en temps réel, les frameworks d'agents vocaux et les outils de déploiement — permettent aux développeurs de créer et de déployer facilement des expériences de génération vocale performantes.
Google collabore également avec des entreprises comme Figma, HeyGen, Linguana, Wondercraft, 99.co et Ollang, qui intègrent les derniers modèles TTS pour accélérer le doublage mondial, localiser des médias avec des accents régionaux nuancés et alimenter des agents vocaux conversationnels à grande échelle.
Disponibilité
Les deux modèles sont déployés à partir d'aujourd'hui.
Gemini 3.8 Flash TTS :
- Pour les développeurs : disponible dans l'API Gemini et Google AI Studio.
- Pour les entreprises : bientôt disponible via l'API dans Gemini Enterprise.
- Pour le grand public : disponible dans Gemini Notebook.
Gemini 3.8 Flash-Lite TTS :
- Pour les développeurs : disponible dans l'API Gemini et Google AI Studio.
- Pour les entreprises : bientôt disponible via l'API dans Gemini Enterprise.
- Pour le grand public : disponible dans Google Vids.
Les capacités signalées comme « bientôt disponibles » par Google — le remixage de voix et l'accès API via Gemini Enterprise — constituent les prochaines étapes à surveiller alors que le déploiement s'étend au-delà des partenaires de lancement actuels et des accès anticipés.
Avec cette sortie, la gamme Gemini Audio couvre la traduction et la transcription en direct, la conversation vocale en temps réel via 3.8 Live et 3.8 Live Extended Thinking, et désormais la génération vocale expressive, offrant aux créateurs, aux développeurs et aux entreprises une famille de modèles unique pour construire des produits pilotés par la voix.