Google presenta Gemini 3.8 TTS: dos modelos y 2.000 voces desde el primer día
Google lanzó el 23 de septiembre de 2026 dos nuevos modelos de texto a voz dentro de la familia Gemini 3.8: gemini-3.8-flash-tts y gemini-3.8-flash-lite-tts, disponibles en la API de Gemini y en Google AI Studio desde el mismo día del anuncio. La compañía los describe como "un estudio creativo dinámico para generar voz", según recoge The Next Web.
El lanzamiento llega apenas unas semanas después de que la base de Gemini 3.8 se estrenara a principios de septiembre, y pone a Google en una posición directa contra ElevenLabs, OpenAI y Murf AI en un mercado de síntesis de voz que ya no es nicho, como apunta CryptoBriefing. Para un founder, lo relevante es que el coste y la calidad de la voz sintética acaban de moverse de forma significativa, y eso cambia qué productos son viables construir.
Qué trae Gemini 3.8 Flash TTS y en qué se diferencia de Flash-Lite
Google dividió el lanzamiento en dos perfiles de uso, según el anuncio oficial recogido por Unite.ai:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Gemini 3.8 Flash TTS: pensado para trabajo creativo (videojuegos, audiolibros, podcasts, medios interactivos), con dirección línea por línea y diseño de personajes.
- Gemini 3.8 Flash-Lite TTS: la variante "low cost", optimizada para doblaje y voice agents de alto volumen, con control fino de tono y ritmo.
Ambos comparten tres capacidades clave que importan a quien construye producto:
- Biblioteca de más de 2.000 voces listas, con variedades regionales como español mexicano, frés quebequés o inglés escocés, según Google.
- Diseño de voz desde prompt: describes el rol, acento y características en lenguaje natural y el sistema genera una voz nueva desde cero. El ejemplo oficial incluye "un DJ enérgico de Melbourne" y "un dragón japonés".
- Clonación con 30 segundos de audio de la voz objetivo. Google exige una grabación de consentimiento verbal del dueño de la voz y verificación de que coincide con la muestra antes de crear el clon.
Los clips generados llevan marca de agua SynthID (invisible, embebida en el audio) y credenciales C2PA para los clones, como documenta el anuncio oficial.
Conversaciones multi-hablante y dirección escena a escena
Una de las funciones más llamativas es la dirección escena a escena desde un único guion. El modelo permite:
- Definir personajes con voz y estilo de entrega distintos por línea (por ejemplo, "entregado con tono calmado y despreocupado").
- Incluir acotaciones no verbales como
<laughs>,<sigh>,<gasp>o interjecciones como "mhm" y "yeah". - Mantener dos hablantes diferenciados en una escena con turnos naturales.
- Generar audio de larga duración con deriva mínima entre personajes, útil para podcasts y audiolibros de varias horas.
Simon Willison, autor del artículo original, lo probó con un guion escrito por Claude 4.5 Opus: dos pelícanos discutiendo si mudarse al Pacifica Pier. Generar 1 minuto y 18 segundos de audio le tomó unos 20 segundos con Gemini 3.8 Flash TTS (no la versión Lite), a un coste de 2,74 centavos de dólar. La configuración se guarda en la URL, lista para compartir.
Benchmarks: dónde gana Google y dónde no
Google presentó sus propios números en el anuncio:
- 89,5% en el Artificial Analysis Pronunciation Robustness Benchmark, frente al 88,2% de su predecesor Gemini 3.1 Flash TTS, según CryptoBriefing.
- 71,4 puntos en el Hume AI Voice Design Benchmark, liderando también la categoría de reproducción de acentos con 60,8 puntos.
- Primer y segundo puesto en el Hume AI Overall Quality Index para Flash y Flash-Lite respectivamente.
- Top en Voice Arena en japonés, portugués brasileño, vietnamita, árabe estándar moderno, español mexicano e hindi.
Pero el mismo mes, el Voice Replication Leaderboard de Hume (publicado el 10 de septiembre de 2026) puso a Fish Audio s2-pro en cabeza de similitud con 4,03 sobre 5, seguido de Cartesia sonic-3.5 con 3,70 y ElevenLabs Multilingual v2 con 3,68. ElevenLabs Eleven v3 quedó último entre 11 modelos con 2,91, según el análisis de Marktechpost. La lectura para founders: Google entra fuerte en calidad de voz y consistencia de personaje, pero en similitud pura de clonación el mercado sigue fragmentado.
Comparativa de precios por millón de caracteres (septiembre 2026)
Para decidir API importa el coste por carácter. Estos son los precios de lista publicados por cada proveedor, según el relevamiento de Marktechpost del 20 de septiembre de 2026:
- ElevenLabs Eleven v3: US$100 por 1M de caracteres (versión Flash: US$50).
- Cartesia Sonic 3.6+: entre US$37 y US$50 por 1M.
- Inworld TTS-2: desde US$25 por 1M on-demand, baja a US$12,50 en planes altos.
- Fish Audio: US$15 por 1M de bytes UTF-8 (texto inglés ~1 byte/carácter; CJK ~3 bytes).
- Hume Octave 2: entre US$50 y US$150 por 1M según plan.
Google no publicó precio por carácter explícito en el anuncio. El dato de Simon Willison (2,74 centavos por 1 minuto 18 segundos) sirve solo como referencia informal: si esa proporción se mantiene, Gemini 3.8 Flash TTS se ubicaría en el rango bajo-medio del mercado.
Limitaciones reales y disponibilidad regional
El model card de Gemini 3.8 Audio, recogido por Unite.ai, lista como limitaciones conocidas las alucinaciones, lentitud ocasional y timeouts. El knowledge cutoff es enero de 2025. Google DeepMind también evaluó los modelos bajo su Frontier Safety Framework y concluyó que no alcanzan niveles críticos de capacidad, en línea con Gemini 3.7 Flash.
Hay un punto crítico para founders con usuarios en Europa o Norteamérica: la replicación de voz vía AI Studio no está disponible en Illinois, Texas, EEE, Reino Unido, Suiza ni la India, según la nota al pie del anuncio. Para despliegues comerciales hay que pasar por la API y verificar caso por caso.
Las plataformas de desarrollador Agora, LiveKit, Pipecat y Vercel ya soportan los modelos. Google nombró como socios de integración a Figma, HeyGen, Wondercraft, Linguana, 99.co y Ollang, para doblaje global, localización y agentes conversacionales.
¿Qué significa esto para tu startup?
Si tu producto genera audio (podcasts automatizados, audiolibros, doblaje, atención al cliente por voz, contenido para redes), el coste y la calidad por defecto acaban de moverse. Tres implicaciones concretas:
- El coste por minuto de audio sintético cae. Con 2,74 centavos por 1m 18s, Flash TTS se sitúa en un rango que hace viable generar audio bajo demanda sin tener que pre-grabar o contratar voces. Productos antes inviables (resúmenes diarios en audio, narración automática de newsletters, asistentes de voz en WhatsApp) pasan a tener economía sana.
- La barrera para audio multi-personaje baja. Antes necesitabas scripts pre-grabados o actores. Ahora defines los personajes en un solo prompt y diriges línea por línea. Esto cambia el coste de producir podcasts serializados, contenido educativo y juegos narrativos sin estudio.
- Cuidado con el compliance regional. Si vendes en la UE o Reino Unido, la replicación de voz tiene restricciones geográficas. Antes de usar clones, valida el caso legal con tu equipo jurídico, sobre todo si entrenas con voces de terceros.
Acciones concretas que puedes tomar esta semana:
- Audita tus llamadas a TTS actuales: si pagas más de US$15 por 1M de caracteres en ElevenLabs v3, vale la pena probar Gemini 3.8 Flash-Lite para tareas de alto volumen (notificaciones, respuestas de agentes) y reservar v3 para marca y contenido creativo.
- Prototipa un caso multi-hablante: usa el playground BYOK de Simon Willison para producir un podcast o audiolibro corto en una tarde. Mide calidad, latencia y coste real contra tu stack actual. Si el resultado es viable, ya tienes un caso de negocio documentado para presentar a tu equipo.
Fuentes
- Gemini 3.8 TTS Playground — Simon Willison
- Google's new Gemini TTS models can clone a voice from 30 seconds of audio — The Next Web
- Google Rolls Out Gemini 3.8 Speech Models In API And AI Studio — Unite.ai
- Gemini 3.8 Flash TTS ranks first in pronunciation robustness benchmark with 89.5% score — CryptoBriefing
- Best Voice Cloning APIs in 2026: Speaker Similarity, Consent Checks, and Price per 1M Characters — Marktechpost
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













