
Gemini 3.8 Flash TTS: progettare voci con prompt di testo
- News
- Rocks on Galaxy
- Apps
- 25 Sep, 2026
- 0
Google trasforma il TTS da selettore di preset in uno studio vocale. Il 23 settembre 2026 arrivano Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS in un post Google di Leland Rechis e Alan Cowen. Flash è per il character design; Flash-Lite per doppiaggio ad alto volume e agenti vocali.
Cosa si può fare oggi
Flash TTS crea voci da prompt in oltre 100 lingue/dialetti e offre una libreria di oltre 2.000 voci. La replicazione ricostruisce un profilo da 30 secondi di una voce di cui si hanno i diritti, con consenso verbale coincidente. Ogni clip Gemini Audio è filigranata con SynthID. Scene native a due speaker.
- Flash: AI Studio, API Gemini, Gemini Enterprise, Gemini Notebook, Google Vids
- Flash-Lite: API e AI Studio ora; Enterprise «in arrivo»; Google Vids
- Limiti geo replica: non in AI Studio in Illinois, Texas, SEE, Regno Unito, Svizzera e India
Google cita Hume Voice Design 71,4 (#1): punteggi pubblicati da Google, non un lab Rocks.
Workflow Studio e partner
L’audio playground di AI Studio è inquadrato come atelier di voice design: prompt di nuove identità o replica (dove consentito), poi editor di sceneggiatura a due speaker. Burst vocali e backchanneling per la texture conversazionale. La famiglia Gemini Audio segue 3.5 Live Translate, 3.5 Transcribe, 3.8 Live e 3.8 Live Extended Thinking. Piattaforme developer citate via API Gemini: Agora, LiveKit, Pipecat, Vercel. Partner: Figma, HeyGen, Linguana, Wondercraft, 99.co, Ollang. Flash-Lite punta a doppiaggio ad alto volume e agenti espressivi: descrizione prodotto Google, non un test di latenza Rocks.
Parere Rocks
Lancio datato, consenso e filigrana espliciti. Il post non elenca prezzi API. Fonte: Google.
Google descrive il passaggio da una trentina di voci originali a una libreria «infinita» via design generativo, con salvataggio delle voci custom per limitare la deriva tra progetti. Voice Arena mette Flash e Flash-Lite in alto nelle preferenze umane alla cieca in diverse lingue chiave (giapponese, portoghese brasiliano, vietnamita, arabo MSA, spagnolo messicano, hindi): risultati pubblicati da Google. Model card e SynthID sono citati per la responsabilità. La replica via AI Studio resta esplicitamente non disponibile in Illinois, Texas, SEE, Regno Unito, Svizzera e India.
Google non elenca prezzi per milione di token in questo annuncio; le tariffe vanno verificate a parte nella documentazione API Gemini.
FAQ
Clonare qualsiasi voce in 30 s? Serve il consenso verbale del titolare; la replica è bloccata in diverse regioni.
Flash = Flash-Lite? No: creativo vs volume/costo.