Gemini 3.8 Flash TTS : concevoir des voix par prompt texte

Gemini 3.8 Flash TTS : concevoir des voix par prompt texte

  • Actus
  • Rocks on Galaxy
  • Apps
  • 25 Sep, 2026
  • 0

Google transforme le TTS d’un sélecteur de préréglages en studio vocal. Le 23 septembre 2026, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS arrivent dans un billet Google de Leland Rechis et Alan Cowen. Flash vise le design de personnages et la direction ligne à ligne ; Flash-Lite le doublage volume et les agents vocaux.

Disponible maintenant

Flash TTS crée des voix par prompt (rôle, accent, timbre) sur plus de 100 langues/dialectes, plus une bibliothèque de 2 000+ voix (espagnol mexicain, français québécois, anglais écossais cités). La réplication reconstruit un profil à partir de 30 secondes d’une voix dont on a les droits, avec enregistrement de consentement oral correspondant au locuteur. Chaque clip Gemini Audio est marqué SynthID ; identifiants C2PA aussi cités. Scènes deux locuteurs natives ; génération longue durée décrite comme stable sur des heures.

  • Flash : AI Studio, API Gemini, Gemini Enterprise, Gemini Notebook, Google Vids
  • Flash-Lite : API et AI Studio maintenant ; Enterprise « bientôt » ; Google Vids
  • Limites géo réplication : pas via AI Studio en Illinois, Texas, EEE, Royaume-Uni, Suisse, Inde
  • Remix : réglage bibliothèque annoncé comme coming soon

Google cite Hume Voice Design 71,4 (#1) et accent 60,8 — scores publiés par Google, pas un labo Rocks.

Workflow Studio et partenaires

L’audio playground d’AI Studio est présenté comme un atelier de design vocal : prompts de nouvelles identités ou réplication (là où c’est autorisé), puis éditeur de scénario à deux locuteurs. Bursts vocaux et backchanneling (interjections d’écoute) pour la texture conversationnelle. La famille Gemini Audio suit 3.5 Live Translate, 3.5 Transcribe, 3.8 Live et 3.8 Live Extended Thinking. Plateformes développeurs citées via l’API Gemini : Agora, LiveKit, Pipecat, Vercel. Partenaires d’intégration : Figma, HeyGen, Linguana, Wondercraft, 99.co, Ollang (doublage, accents, agents). Flash-Lite vise le doublage volume et les agents expressifs — description produit Google, pas un test de latence Rocks.

Avis Rocks

Lancement daté, consentement et filigrane explicites, zones de clonage bloquées listées. Pas de tarif API $/million dans ce billet. Source : Google.

Google décrit un passage d’une trentaine de voix d’origine à une bibliothèque « infinie » via le design génératif, avec sauvegarde des voix custom pour limiter la dérive entre projets. Voice Arena place Flash et Flash-Lite en tête sur des préférences humaines en aveugle pour plusieurs langues clés (japonais, portugais brésilien, vietnamien, arabe MSA, espagnol mexicain, hindi) — résultats publiés par Google. La fiche modèle et SynthID sont renvoyés pour la responsabilité. La réplication via AI Studio reste explicitement indisponible en Illinois, Texas, EEE, Royaume-Uni, Suisse et Inde.

FAQ

Cloner n’importe quelle voix en 30 s ? Consentement oral du propriétaire exigé ; réplication AI Studio bloquée dans plusieurs régions.

Flash = Flash-Lite ? Non : créatif vs volume/coût.