Google Gemini 3.8 Flash TTS: el estudio de voz que cabe en un prompt
Google DeepMind presentó este martes dos nuevos modelos de texto a voz que suben claramente la apuesta en generación de audio con IA: Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS. Ambos llegan para convertir la síntesis de voz de "presets fijos" en lo que la compañía describe como un estudio creativo dinámico: diseño de voces desde cero con prompts en lenguaje natural, réplica de voz con verificación de consentimiento y dirección de actuación línea por línea.
Para los founders, el anuncio importa por dos razones concretas: baja la barrera para producir audio multilingüe de calidad estudio —audiobooks, podcasts, cursos, localización de video— sin contratar locutores, y abre una API que ya están integrando plataformas como Figma, HeyGen, Wondercraft, Linguana, 99.co y Ollang.
Qué traen los dos modelos y cuándo se diferencian
Google separó la oferta en dos perfiles de uso bien marcados, una estrategia que ya vimos en el resto de la familia Gemini:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Gemini 3.8 Flash TTS: pensado para dirección creativa profunda y diseño de personajes. Permite crear voces totalmente nuevas desde cero con prompts en lenguaje natural, desde un dragón que escupe fuego hasta un narrador con cadencia regional específica. Da control granular sobre cada línea: pausas, cambios de dialecto, risas, suspiros.
- Gemini 3.8 Flash-Lite TTS: optimizado para alto volumen y costo eficiente. El destino natural son doblaje masivo, generación de contenido de audio y agentes de voz expresivos con control fino sobre tono y ritmo.
Ambos están disponibles desde este martes para desarrolladores en la API de Gemini y Google AI Studio. El modelo Flash también llega a consumidores a través de Gemini Notebook, mientras que Flash-Lite se integra en Google Vids. La versión empresarial vía Gemini Enterprise queda listada como próximamente.
Diseño, réplica y remix: las tres palancas para crear voces
El corazón del anuncio son las capacidades de personalización. La compañía resume el flujo en tres pasos:
1. Diseño generativo de voz. Con Gemini 3.8 Flash TTS puedes crear voces a medida definiendo rol, acento y características vocales en más de 100 idiomas y dialectos mediante prompting natural. No hay que entrenar nada.
2. Biblioteca expansiva. El modelo se apoya en una librería con más de 2.000 voces listas para producción, con cobertura de variedades regionales como español de México, francés quebequés o inglés escocés. La promesa es pasar de las 30 voces originales de la generación anterior a un catálogo prácticamente ilimitado.
3. Réplica de voz. Puedes recrear un perfil vocal consistente a partir de solo 30 segundos de audio de tu propia voz, o de alguien que te haya dado derechos. El sistema exige una grabación de consentimiento verbal del dueño de la voz antes de generar la réplica. Cada clip de audio lleva marca de agua SynthID invisible y credenciales C2PA para proteger tanto a desarrolladores como al talento vocal.
Google también adelantó que el voice remixing llegará próximamente: elegir una voz de la librería y ajustar timbre, tono, ritmo y acento con prompts del tipo "añade un sutil acento sureño estadounidense" o "suaviza la entrega".
Dirección escena por escena: el control que importa para creadores
Más allá del diseño, lo que distingue a esta generación es el control por línea. Los dos modelos permiten escribir acotaciones de escena o dejar que Gemini dirija la entrega con indicaciones de guion, desde un agente de servicio al cliente calmado hasta una escena de suspense susurrada.
Las funciones concretas que destaca el anuncio:
- Generación de formato largo: mantiene calidad, ritmo natural y timbre del personaje a lo largo de horas de audio continuo con mínima deriva entre hablantes, clave para podcasts y audiobooks.
- Escenas nativas con dos hablantes: dirige conversaciones multi-turno desde un solo guion manteniendo ambas voces claramente separadas, con turnos conversacionales naturales.
- Estallidos vocales guionados y backchanneling: puedes añadir risas (
<laughs>), suspiros (<sigh>), jadeos (<gasp>) e interjecciones de escucha activa (|mhm|,|yeah|) para conseguir timing cómico y reacciones precisas.
Los benchmarks: dónde gana Gemini 3.8 Flash TTS
Google no se limita a prometer: publica números. Según el comunicado oficial:
- #1 en el Voice Design Benchmark de Hume AI con 71.4 puntos, y #1 también en modelado de acentos con 60.8.
- #1 y #2 respectivamente en el Overall Quality Index de Hume AI para Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS.
- Mejoras significativas frente a Gemini 3.1 Flash TTS en contenido de formato largo y control de guion con dos hablantes.
- En evaluaciones ciegas de preferencia humana en Voice Arena, los dos modelos logran posiciones destacadas en japonés, portugués brasileño, vietnamita, árabe estándar moderno, español de México e hindi.
El ecosistema que ya se está integrando
El lanzamiento llega con una lista de partners que vale más que cualquier benchmark: las plataformas para desarrolladores Agora, LiveKit, Pipecat y Vercel ya habilitan experiencias de generación de voz de alto rendimiento sobre la API de Gemini. Y las empresas que están integrando los modelos para doblaje global, localización con acentos regionales y agentes conversacionales a escala incluyen Figma, HeyGen, Linguana, Wondercraft, 99.co y Ollang.
El contexto: el calendario exprés de Gemini 3.8
Este anuncio llega en medio de una ofensiva de velocidad inusual por parte de Google. Según reportó Ars Technica, Gemini 3.8 Flash es el tercer modelo Flash que Google lanza en seis semanas, sin que la compañía haya presentado un Gemini Pro de frontera desde principios de 2026. The Wall Street Journal, citado por Yahoo Finance, señaló que el modelo —conocido internamente como "Skimaki"— fue diseñado específicamente para cerrar la brecha en codificación agentica donde Google venía detrás de OpenAI y Anthropic, y que en pruebas internas los ingenieros lo prefirieron sobre Claude Opus de Anthropic.
The Verge, por su parte, reportó que Gemini 3.8 Flash mantiene el precio introductorio de su predecesor (US$0,75 por millón de tokens de entrada y US$3,75 por millón de tokens de salida hasta fin de año), aunque advierte que el modelo "podría usar más tokens para maximizar rendimiento", lo que en la práctica puede disparar hasta un 40% el costo por tarea según Artificial Analysis.
Aunque esos precios son del modelo de texto general, marcan la línea de pricing que probablemente acompañe a las variantes TTS cuando se incorporen al pricing por caracteres estándar de la API.
Qué significa esto para tu startup
Si tu producto genera o localiza audio —cursos, contenido educativo, podcasts, agentes conversacionales, atención al cliente— esta camada de modelos cambia tres ecuaciones de costo:
- Producción multilingüe sin contratar locutores. Con 2.000+ voces listas y soporte para más de 100 idiomas (incluidos español de México, portugués brasileño y árabe estándar), puedes doblar contenido a mercados que antes no justificaban una producción profesional. Acción concreta: audita tu backlog de contenido en video o audio y estima cuánto costaría localizarlo frente a producirlo con TTS en una primera iteración.
- Personajes de marca consistentes. La posibilidad de diseñar, guardar y escalar una voz propia elimina la dependencia de talento vocal para escalar campañas o asistentes. Acción concreta: define una voz de marca (ritmo, tono, acento regional) y pruébala en tu flujo de atención al cliente o en tu onboarding antes de invertir en una grabación humana cara.
- Dirección escena por escena con prompt. El control de pausas, risas, suspiros y backchanneling baja el valle inquietante del audio sintético. Acción concreta: toma un guion existente (un anuncio, una lección, una escena de demo) y experimenta con acotaciones inline antes de hacer una grabación tradicional.
La barrera de entrada para audio de calidad estudio acaba de caer otro escalón. La pregunta para el founder ya no es si puede producir audio multilingüe, sino qué producto construye ahora que esa variable dejó de ser un cuello de botella.
Fuentes
- Say hello to Gemini 3.8 text-to-speech (fuente original)
- Google releases Gemini 3.8 Flash, its third Flash model in six weeks
- Google prepares Gemini 3.8 Flash to narrow AI coding gap, WSJ reports
- Google says its new Gemini 3.8 Flash model 'works harder' but might cost more
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














