Google lanza Gemini 3.5 Transcribe con un WER del 2,6% y disponibilidad en preview para developers
Google presentó Gemini 3.5 Transcribe, su modelo de voz a texto más preciso hasta la fecha, que alcanza un Word Error Rate (WER) promedio del 2,6% en modo no-streaming y del 4,0% en streaming, según la medición independiente de Artificial Analysis citada en el anuncio oficial. El modelo ya está disponible en public preview dentro de la Gemini API, Google AI Studio y Google Antigravity, y llega acompañado de dos nuevos miembros de la familia Gemini 3.5 —Gemini 3.5 Live y Gemini 3.5 Live Experimental— que Google agrupa bajo la marca Gemini Audio.
Para los founders hispanohablantes que están construyendo productos con voz, la cifra que importa es el WER del 2,6%: en términos prácticos, eso significa que puedes pasar audio en crudo a texto útil sin tener que montar un pipeline de limpieza, suavizado ni post-edición. Y todo dentro de la API que ya integraste cuando sumaste Gemini a tu stack.
Qué cambia frente a Chirp 3 y por qué Google lo presenta como un salto mayor
El blog de Google DeepMind describe a 3.5 Transcribe como un "avance importante" sobre el modelo anterior, Chirp 3, que según el calendario documentado entró en public preview en agosto de 2025 y alcanzó GA en octubre de 2025 en Speech-to-Text V2. Las mejoras que Google reporta en el anuncio son tres:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Latencia: el time to final transcription mejora un 70% frente a Chirp 3.
- Multilingüe: en el benchmark FLEURS, 3.5 Transcribe alcanza un 5,50% WER en streaming y 5,04% en no-streaming, mejorando a Chirp 3 en idiomas y locales principales.
- Calidad de salida: elimina "ums" y "ahs", corrige auto-correcciones naturales (del tipo "quedamos el martes —no, el miércoles") y formatea el texto automáticamente.
The Verge recuerda que el modelo llega en un contexto singular: seguimos esperando el lanzamiento de Gemini 3.5 Pro, prometido originalmente para junio, mientras Google ya puso en la calle Gemini 3.6 y Gemini 3.7. Es decir, la familia 3.5 se sigue expandiendo por la puerta de audio antes de que el modelo principal vea la luz general.
Las dos APIs: streaming en vivo y procesamiento de archivos
Google ofrece Gemini 3.5 Transcribe a través de dos endpoints separados, según el caso de uso:
- gemini-3.5-transcribe-live vía la Live API: streaming bidireccional continuo con latencia inferior al segundo, pensado para agentes de voz interactivos y captioning en tiempo real.
- gemini-3.5-transcribe vía la Interactions API: transcripción de audio pre-grabado —reuniones, logs de llamadas, archivos— con atribución de hasta 3 speakers (soporte experimental para más) y timestamps a nivel de palabra.
Ambas APIs admiten más de 85 idiomas con detección automática, manejo de acentos regionales y dialectos, vocabulario personalizado para jerga especializada (nombres de producto, identificadores internos, terminología clínica o legal) y reconocimiento robusto de entidades alfanuméricas como códigos postales y order IDs.
Capacidades de function calling y el ecosistema de developers que ya lo integra
Una de las piezas más interesantes para construir productos diferenciados es la integración con function calling. Gemini 3.5 Transcribe puede delegar tareas complejas —generación de imágenes, análisis de archivos, resúmenes— a otros modelos Gemini en segundo plano. Según Google, esa capacidad ya está activa en la app de Gemini en macOS y se extenderá al resto del stack.
El blog oficial menciona además que plataformas de developers como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents ya están usando la Gemini Live API como base de sus productos de voz. Empresas como Vivo, Intellitek Health y Lingopal compartieron feedback positivo en la nota oficial, destacando especialmente la latencia, la precisión y la cobertura de idiomas.
En el frente de consumo, 3.5 Transcribe ya estaba operando —sin anuncio formal— dentro de:
- Rambler en Gboard (Android): dictado con formato y limpieza de muletillas en países e idiomas seleccionados.
- Google Antigravity: transcripción en el prompt box con contexto de pantalla y chat history.
- Gemini app en macOS: dictado + comandos de voz que disparan workflows con contexto de pantalla.
- Chrome (próximamente): dictado nativo en cualquier campo web.
Posicionamiento frente a Deepgram, AssemblyAI y ElevenLabs
Gemini 3.5 Transcribe entra en un mercado de transcripción que ya tiene actores consolidados. ElevenLabs cotiza su modelo Scribe v2 a US$0,22/hora y Scribe v2 Realtime a US$0,39/hora, según su página de precios. Chirp 3 STT en Google Cloud Speech-to-Text V2 lista precios de US$0,016/min para el tier estándar y US$0,003/min para dynamic batch.
Google no publicó pricing específico para los endpoints nuevos gemini-3.5-transcribe-live y gemini-3.5-transcribe en el anuncio de DeepMind: habrá que esperar a la documentación de la Gemini API. En el benchmark independiente de Artificial Analysis, Chirp 3 Streaming lideraba partial-transcript en VoxPopuli con 2,2% WER, pero ningún modelo lidera todos los datasets a la vez. 3.5 Transcribe hereda esa posición de partida y la mejora según las cifras oficiales del anuncio.
Qué significa esto para tu startup
Si estás construyendo un producto SaaS con voz —agentes de atención al cliente, herramientas de reunión, plataformas de salud, edtech, periodismo automatizado, legaltech—, el cambio relevante no es solo "una API más precisa". Es que la limpieza de muletillas, la auto-corrección de auto-interrupciones, el formateo automático y la atribución de speakers salen del pipeline de post-procesamiento y entran al modelo. Eso recorta trabajo de NLP custom, baja la latencia perceptible y reduce el costo operativo por minuto transcrito.
Acciones concretas que puedes tomar esta semana:
- Audita tu pipeline actual de transcripción. Si tienes wrappers sobre Whisper o Deepgram, vale la pena correr un lote de prueba contra
gemini-3.5-transcribeen AI Studio y comparar WER en tu audio real —no en benchmarks genéricos. La diferencia entre 5% y 2,6% se nota muchísimo en casos con jerga técnica. - Explora el endpoint Live antes de comprometer arquitectura.
gemini-3.5-transcribe-livecon sub-segundo de latencia habilita casos que antes requerían WebSockets propios y VAD custom: subtitulado en vivo, voicebots reactivos, copilots con speech-to-text continuo. Si tu roadmap tiene cualquiera de estos, este es el momento de probar. - Inyecta vocabulario de dominio desde el día uno. El soporte de custom vocabulary permite que el modelo aprenda nombres de productos, SKUs, identificadores y jerga interna sin reentrenar nada. Para founders en LATAM y España que atienden clientes con mezclas español-inglés o español-catalán, esa pieza suele ser la que decide la batalla del WER en producción.
El movimiento de Google llega justo cuando la categoría "voz a texto" deja de ser commodity y empieza a convertirse en infraestructura conversacional completa —con function calling, contexto de pantalla y multi-speaker incluido—. Quien construya sobre estas APIs en los próximos meses va a definir la siguiente generación de productos de voz en español.
Fuentes
- Intelligent transcription with Gemini 3.5 Transcribe — Google DeepMind
- Google launches Gemini 3.5 Transcribe, which powers Gboard Rambler & is coming to Chrome — 9to5Google
- Google's new AI transcription edits out your 'ums' and 'ahs' — The Verge
- Google rolls out Gemini Audio to improve real-time dialogue and speech recognition — Android Authority
- Chirp 3: inside Google Cloud's 2025 speech stack — Open Transcription
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














