Gemini 3.5 Transcribe: voz a texto de Google con WER del 2,6%

Google lanza Gemini 3.5 Transcribe con un WER del 2,6% y disponibilidad en preview para developers

Google presentó Gemini 3.5 Transcribe, su modelo de voz a texto más preciso hasta la fecha, que alcanza un Word Error Rate (WER) promedio del 2,6% en modo no-streaming y del 4,0% en streaming, según la medición independiente de Artificial Analysis citada en el anuncio oficial. El modelo ya está disponible en public preview dentro de la Gemini API, Google AI Studio y Google Antigravity, y llega acompañado de dos nuevos miembros de la familia Gemini 3.5 —Gemini 3.5 Live y Gemini 3.5 Live Experimental— que Google agrupa bajo la marca Gemini Audio.

Para los founders hispanohablantes que están construyendo productos con voz, la cifra que importa es el WER del 2,6%: en términos prácticos, eso significa que puedes pasar audio en crudo a texto útil sin tener que montar un pipeline de limpieza, suavizado ni post-edición. Y todo dentro de la API que ya integraste cuando sumaste Gemini a tu stack.

Qué cambia frente a Chirp 3 y por qué Google lo presenta como un salto mayor

El blog de Google DeepMind describe a 3.5 Transcribe como un "avance importante" sobre el modelo anterior, Chirp 3, que según el calendario documentado entró en public preview en agosto de 2025 y alcanzó GA en octubre de 2025 en Speech-to-Text V2. Las mejoras que Google reporta en el anuncio son tres:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Latencia: el time to final transcription mejora un 70% frente a Chirp 3.
  • Multilingüe: en el benchmark FLEURS, 3.5 Transcribe alcanza un 5,50% WER en streaming y 5,04% en no-streaming, mejorando a Chirp 3 en idiomas y locales principales.
  • Calidad de salida: elimina "ums" y "ahs", corrige auto-correcciones naturales (del tipo "quedamos el martes —no, el miércoles") y formatea el texto automáticamente.

The Verge recuerda que el modelo llega en un contexto singular: seguimos esperando el lanzamiento de Gemini 3.5 Pro, prometido originalmente para junio, mientras Google ya puso en la calle Gemini 3.6 y Gemini 3.7. Es decir, la familia 3.5 se sigue expandiendo por la puerta de audio antes de que el modelo principal vea la luz general.

Las dos APIs: streaming en vivo y procesamiento de archivos

Google ofrece Gemini 3.5 Transcribe a través de dos endpoints separados, según el caso de uso:

  • gemini-3.5-transcribe-live vía la Live API: streaming bidireccional continuo con latencia inferior al segundo, pensado para agentes de voz interactivos y captioning en tiempo real.
  • gemini-3.5-transcribe vía la Interactions API: transcripción de audio pre-grabado —reuniones, logs de llamadas, archivos— con atribución de hasta 3 speakers (soporte experimental para más) y timestamps a nivel de palabra.

Ambas APIs admiten más de 85 idiomas con detección automática, manejo de acentos regionales y dialectos, vocabulario personalizado para jerga especializada (nombres de producto, identificadores internos, terminología clínica o legal) y reconocimiento robusto de entidades alfanuméricas como códigos postales y order IDs.

Capacidades de function calling y el ecosistema de developers que ya lo integra

Una de las piezas más interesantes para construir productos diferenciados es la integración con function calling. Gemini 3.5 Transcribe puede delegar tareas complejas —generación de imágenes, análisis de archivos, resúmenes— a otros modelos Gemini en segundo plano. Según Google, esa capacidad ya está activa en la app de Gemini en macOS y se extenderá al resto del stack.

El blog oficial menciona además que plataformas de developers como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents ya están usando la Gemini Live API como base de sus productos de voz. Empresas como Vivo, Intellitek Health y Lingopal compartieron feedback positivo en la nota oficial, destacando especialmente la latencia, la precisión y la cobertura de idiomas.

En el frente de consumo, 3.5 Transcribe ya estaba operando —sin anuncio formal— dentro de:

  • Rambler en Gboard (Android): dictado con formato y limpieza de muletillas en países e idiomas seleccionados.
  • Google Antigravity: transcripción en el prompt box con contexto de pantalla y chat history.
  • Gemini app en macOS: dictado + comandos de voz que disparan workflows con contexto de pantalla.
  • Chrome (próximamente): dictado nativo en cualquier campo web.

Posicionamiento frente a Deepgram, AssemblyAI y ElevenLabs

Gemini 3.5 Transcribe entra en un mercado de transcripción que ya tiene actores consolidados. ElevenLabs cotiza su modelo Scribe v2 a US$0,22/hora y Scribe v2 Realtime a US$0,39/hora, según su página de precios. Chirp 3 STT en Google Cloud Speech-to-Text V2 lista precios de US$0,016/min para el tier estándar y US$0,003/min para dynamic batch.

Google no publicó pricing específico para los endpoints nuevos gemini-3.5-transcribe-live y gemini-3.5-transcribe en el anuncio de DeepMind: habrá que esperar a la documentación de la Gemini API. En el benchmark independiente de Artificial Analysis, Chirp 3 Streaming lideraba partial-transcript en VoxPopuli con 2,2% WER, pero ningún modelo lidera todos los datasets a la vez. 3.5 Transcribe hereda esa posición de partida y la mejora según las cifras oficiales del anuncio.

Qué significa esto para tu startup

Si estás construyendo un producto SaaS con voz —agentes de atención al cliente, herramientas de reunión, plataformas de salud, edtech, periodismo automatizado, legaltech—, el cambio relevante no es solo "una API más precisa". Es que la limpieza de muletillas, la auto-corrección de auto-interrupciones, el formateo automático y la atribución de speakers salen del pipeline de post-procesamiento y entran al modelo. Eso recorta trabajo de NLP custom, baja la latencia perceptible y reduce el costo operativo por minuto transcrito.

Acciones concretas que puedes tomar esta semana:

  • Audita tu pipeline actual de transcripción. Si tienes wrappers sobre Whisper o Deepgram, vale la pena correr un lote de prueba contra gemini-3.5-transcribe en AI Studio y comparar WER en tu audio real —no en benchmarks genéricos. La diferencia entre 5% y 2,6% se nota muchísimo en casos con jerga técnica.
  • Explora el endpoint Live antes de comprometer arquitectura. gemini-3.5-transcribe-live con sub-segundo de latencia habilita casos que antes requerían WebSockets propios y VAD custom: subtitulado en vivo, voicebots reactivos, copilots con speech-to-text continuo. Si tu roadmap tiene cualquiera de estos, este es el momento de probar.
  • Inyecta vocabulario de dominio desde el día uno. El soporte de custom vocabulary permite que el modelo aprenda nombres de productos, SKUs, identificadores y jerga interna sin reentrenar nada. Para founders en LATAM y España que atienden clientes con mezclas español-inglés o español-catalán, esa pieza suele ser la que decide la batalla del WER en producción.

El movimiento de Google llega justo cuando la categoría "voz a texto" deja de ser commodity y empieza a convertirse en infraestructura conversacional completa —con function calling, contexto de pantalla y multi-speaker incluido—. Quien construya sobre estas APIs en los próximos meses va a definir la siguiente generación de productos de voz en español.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...