Gemini 3.8 Flash TTS: diseñar voces con prompts de texto

Gemini 3.8 Flash TTS: diseñar voces con prompts de texto

  • Noticias
  • Rocks on Galaxy
  • Apps
  • 25 Sep, 2026
  • 0

Google convierte el TTS de un selector de presets en un estudio de voz. El 23 de septiembre de 2026 llegan Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS en un post de Google de Leland Rechis y Alan Cowen. Flash apunta a diseño de personajes; Flash-Lite a doblaje de volumen y agentes de voz.

Qué se puede hacer hoy

Flash TTS crea voces por prompt en más de 100 idiomas/dialectos y ofrece una biblioteca de más de 2.000 voces. La replicación reconstruye un perfil a partir de 30 segundos de una voz de la que se tienen derechos, con consentimiento verbal coincidente. Cada clip de Gemini Audio lleva SynthID. Escenas nativas a dos locutores.

  • Flash: AI Studio, API Gemini, Gemini Enterprise, Gemini Notebook, Google Vids
  • Flash-Lite: API y AI Studio ahora; Enterprise «próximamente»; Google Vids
  • Límites geo de réplica: no en AI Studio en Illinois, Texas, EEE, Reino Unido, Suiza e India

Google cita Hume Voice Design 71,4 (#1): cifras publicadas por Google, no un laboratorio Rocks.

Flujo en Studio y socios

El playground de audio de AI Studio se presenta como un taller de diseño vocal: prompts de nuevas identidades o réplica (donde esté permitido), luego editor de guion a dos locutores. Burst vocales y backchanneling para textura conversacional. La familia Gemini Audio sigue a 3.5 Live Translate, 3.5 Transcribe, 3.8 Live y 3.8 Live Extended Thinking. Plataformas de desarrolladores citadas vía API Gemini: Agora, LiveKit, Pipecat, Vercel. Socios: Figma, HeyGen, Linguana, Wondercraft, 99.co, Ollang. Flash-Lite apunta a doblaje de volumen y agentes expresivos: descripción de producto Google, no un test de latencia Rocks.

Opinión Rocks

Lanzamiento fechado, consentimiento y marca de agua explícitos. El post no lista precios API. Fuente: Google.

Google describe el paso de unas 30 voces originales a una biblioteca «infinita» vía diseño generativo, con guardado de voces custom para limitar la deriva entre proyectos. Voice Arena sitúa a Flash y Flash-Lite arriba en preferencias humanas a ciegas en varias lenguas clave (japonés, portugués brasileño, vietnamita, árabe MSA, español mexicano, hindi): resultados publicados por Google. La model card y SynthID se citan para responsabilidad. La réplica vía AI Studio sigue explícitamente no disponible en Illinois, Texas, EEE, Reino Unido, Suiza e India.

Google no lista precios por millón de tokens en este anuncio; consultas de tarifa aparte en la documentación de la API Gemini.

FAQ

¿Clonar cualquier voz en 30 s? Hace falta consentimiento verbal del titular; la réplica está bloqueada en varias regiones.

¿Flash = Flash-Lite? No: creativo frente a volumen/coste.