Gemini 3.5 Transcribe: 85+ idiomas y borra ‘ums’ de tu voz

Gemini 3.5 Transcribe: qué cambia frente a Chirp 3

Google presentó este 26 de agosto de 2026 la familia Gemini Audio, un trío de modelos —Gemini 3.5 Transcribe, Gemini 3.5 Live y Gemini 3.5 Live Experimental— diseñados para reconocimiento de voz y diálogo en tiempo real. La pieza más interesante para developers hispanohablantes es Gemini 3.5 Transcribe, que reemplaza al modelo anterior Chirp 3 y se posiciona, según la propia compañía, como el modelo de voz a texto más preciso de su catálogo.

El salto no es solo en precisión bruta, sino en tres capacidades que Chirp 3 no tenía y que cambian el producto:

  • Edición por voz en lenguaje natural. El usuario puede decir cosas como "borra el último párrafo" o "ponle comillas a esta frase" y el modelo reformatea el texto al instante.
  • Limpieza automática de muletillas. Las pausas "um", "eh", "ahs" se eliminan del resultado sin intervención manual.
  • Vocabulario personalizado. Se le puede inyectar una lista de jerga técnica, nombres propios o grafías específicas para que el motor no los mal escriba.

Según datos publicados por 9to5Google y medidos por Artificial Analysis, el modelo alcanza un Word Error Rate (WER) del 4,0% en streaming y del 2,6% en archivos no-streaming, frente al 5,50% y 5,04% que logra en el benchmark multilingüe FLEURS. Además, Google asegura que el tiempo hasta transcripción final mejora un 70% respecto a Chirp 3, una métrica crítica para flujos donde el audio entra en cola.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Qué hace exactamente el nuevo modelo de transcripción

Gemini 3.5 Transcribe viene con un paquete de funciones que apunta a casos de uso que cualquier founder reconoce:

  • Detección automática de más de 85 idiomas, con manejo de acentos regionales y dialectos. En la práctica, un audio mezclando español de México, argentino y español de España puede entrar sin pre-configuración.
  • Auto-correcciones del hablante. Si alguien dice "quedamos el martes—no, el miércoles", el modelo lo registra correctamente como miércoles, sin edición posterior.
  • Auto-formato del texto. Mayúsculas, puntuación y saltos de párrafo se generan solos, lo que elimina el muro de texto sin estructura que devuelve Whisper cuando se le pasa audio crudo.
  • Identificación de hasta 3 hablantes en audio pre-grabado, con timestamps a nivel de palabra. A partir del cuarto hablante el soporte es experimental.
  • Function calling. El modelo puede delegar tareas a otros Gemini (análisis de imagen o de archivos) una vez terminada la transcripción, encadenando pipelines sin glue code intermedio.

El modelo está disponible desde hoy en inglés en la app de Gemini para macOS y en la función Rambler de Gboard en Android, en países e idiomas seleccionados. Para developers, está en public preview en la API de Gemini a través de AI Studio y Google Antigravity, y Google confirmó que el soporte para Chrome llegará pronto.

Gemini 3.5 Live y la versión Experimental: lo nuevo en conversación por voz

Los otros dos modelos apuntan a un terreno distinto: la conversación por voz en vivo.

Gemini 3.5 Live está pensado para alimentar el modo de voz de Gemini y resolver tres problemas clásicos: interrupciones a mitad de frase, cambio de idioma sobre la marcha y procesamiento visual en vivo (mostrarle al modelo algo con la cámara mientras se habla). No pausa el turno del usuario cuando este cambia de tema o de idioma, según describe The Verge.

Gemini 3.5 Live Experimental va un paso más allá: narra su progreso paso a paso mientras razona sobre tareas complejas, en lugar de quedarse en silencio hasta devolver la respuesta final. Es la versión que Google está usando como campo de pruebas para agentes de voz que piensen en voz alta. Según Android Authority, los tres modelos ya están rodando en Search Live, Gemini Live, Docs, Keep, Gmail, la app de Gemini y Gboard.

Precios comparados: dónde queda Gemini frente a Whisper, AssemblyAI y Deepgram

Google no publicó el precio por minuto de Gemini 3.5 Transcribe en el anuncio —la API está en public preview— y, según el patrón habitual de la casa, los rates suelen comunicarse cuando el modelo sale de preview. Mientras tanto, el resto del mercado sirve como referencia. Según CostBench, en datos verificados en julio de 2026:

  • OpenAI Whisper / GPT-4o Transcribe: USD 0,006 por minuto (USD 0,36/hora). El tier Mini baja a USD 0,003/min (USD 0,18/hora).
  • AWS Transcribe: USD 0,024/min en tarifa base, con descuentos por volumen que bajan hasta USD 0,0078/min por encima de 5 millones de minutos.
  • Google Cloud Speech-to-Text: USD 0,016/min en tarifa base, según el mismo reporte.
  • Deepgram Nova-3: USD 0,0043–USD 0,0077/min según el plan, con USD 200 en créditos para nuevos usuarios.
  • AssemblyAI: USD 0,15–USD 0,37/min para cargas con diarización y análisis enriquecido.

El dato relevante para un founder: Gemini 3.5 Transcribe entra como reemplazo directo de Chirp 3 dentro del ecosistema Google, y por la historia de pricing de la casa (recordar que Gemini 1.5 Flash se lanzó con tarifas agresivas) es razonable esperar que el rate por minuto quede alineado o por debajo de Whisper cuando se concrete. Pero eso es una inferencia sobre el patrón, no un anuncio: conviene revisar la página de pricing de la API cuando salga de preview.

Qué significa esto para tu startup

Tres implicancias concretas para quien está construyendo producto con voz o audio:

  • Aplica a productos que ya tenés en producción. Si hoy usás Whisper o AssemblyAI y sumaste post-procesado a mano para borrar muletillas, formatear párrafos y asignar hablantes, probá Gemini 3.5 Transcribe en AI Studio antes de migrar: la promesa oficial es que ese pipeline se reduce a una sola llamada a la API.
  • Lanzá features de voz en español sin diccionario previo. La detección automática de 85+ idiomas elimina la necesidad de configurar locale a locale. Para una startup hispana que sirve a clientes en México, Colombia y España al mismo tiempo, eso baja el costo de entrada a cada mercado.
  • Pensá en voz como input, no como salida. Con function calling, Transcribe puede disparar generación de imágenes o análisis de archivos como continuación natural del dictado. Eso habilita flujos de "hablar y que el sistema actúe" sin pegamento intermedio, un patrón útil para agentes internos, field ops y atención al cliente.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...