Google acelera la transcripción por voz con Gemini 3.5 Transcribe
Google presentó este 26 de agosto Gemini 3.5 Transcribe, un modelo de IA enfocado en speech-to-text que, según la compañía, es cerca de 70% más rápido desde que el usuario habla hasta que obtiene el texto final, y reduce la tasa de error en habla en vivo a 5,5%, frente al 7,32% de su predecesor Chirp 3. Ars Technica fue uno de los primeros en reportar el anuncio; The Verge y Android Authority ampliaron los detalles técnicos y de disponibilidad.
¿Qué hace diferente a Gemini 3.5 Transcribe?
Más allá de la métrica bruta de velocidad, el modelo introduce tres capacidades que cambian la experiencia de dictado:
- Edición inteligente en tiempo real. El sistema elimina muletillas ("eh", "um", "este") mientras el usuario habla, y reformatea el texto para que llegue pulido en lugar de un volcado literal de lo que se dijo.
- Vocabulario personalizado. Los desarrolladores pueden inyectar una lista de términos —jerga técnica, nombres propios, marcas— para que la transcripción respete la ortografía y no los "corrija" como errores.
- Multilingüe y multi-hablante. Reconoce más de 85 idiomas con detección automática y puede atribuir el habla a hasta tres hablantes distintos en audio pregrabado, con marcas de tiempo a nivel de palabra.
Según Android Authority, la tasa de error por palabra (WER) se ubica en 4% para audio en streaming y 2,6% para archivos pregrabados en condiciones reales de ruido de fondo y conversaciones.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadDónde estará disponible y por qué importa a developers
Gemini 3.5 Transcribe ya está activo en Gboard con la función "Rambler" para el Pixel 11, y a partir del anuncio se expande a:
- App de Gemini en macOS (en inglés).
- Rambler en Android, en países e idiomas seleccionados.
- Google AI Studio y Google Antigravity, en vista previa pública, accesible vía la API de Gemini.
- Próximamente, Chrome para dictado en cualquier campo web.
Google también confirmó que el modelo llegará a Search Live, Gemini Live, Docs, Keep, Gmail, la plataforma Gemini Enterprise Agent Platform y la solución Gemini Enterprise for Customer Experience, según Android Authority. Esto último abre la puerta a integraciones con centros de contacto y asistentes conversacionales internos, donde la transcripción limpia ya es un cuello de botella.
Para developers hispanohablantes, la combinación de detección automática de idioma + vocabulario personalizado tiene una aplicación directa: chatbots de soporte que pasan de transcripción literal a transcripción apta para guardar en CRM sin pasar por limpieza humana.
¿Cómo se compara con Chirp 3 y con la competencia?
El salto respecto a Chirp 3 es modesto en precisión bruta (de 7,32% a 5,5% de error en vivo, reporta Google), pero relevante en velocidad y, sobre todo, en el flujo: la edición de muletillas ocurre dentro del modelo, no en un paso posterior. Eso recorta el trabajo de post-procesado y acerca la salida a algo "publicable" sin tocar.
En el contexto más amplio del sector, Google mantiene un calendario de lanzamientos muy activo: el 21 de julio lanzó Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber, según TechCrunch. En paralelo, OpenAI ha desplegado GPT-5.5 y avanza con GPT-5.6, mientras Anthropic presentó Claude Opus 4.8, Claude Sonnet 5 y expandió el acceso al modelo frontier Fable 5. La guerra de versiones ya no se mide solo en benchmarks de razonamiento: la transcripción y el audio en tiempo real son el nuevo frente.
Otro dato relevante: el modelo Gemini 3.5 Pro sigue sin lanzarse, pese a que Google lo había prometido para junio y a que, según TechCrunch, ya estaba en uso interno. Logan Kilpatrick, product lead en Google DeepMind, dijo que el equipo lo está probando con socios y que confía en lanzarlo "pronto".
¿Qué significa esto para tu startup?
Si tu producto depende de dictado, llamadas, entrevistas, notas de reunión o atención al cliente por voz, este anuncio cambia el cálculo de costos. Pasás de pagar por una transcripción cruda + un paso de limpieza a delegar ambas tareas al mismo modelo, con la API como canal de integración.
Acciones concretas que podés tomar esta semana:
- Auditar tu pipeline actual de transcripción. Si usás Whisper, AssemblyAI o el propio Chirp 3, probá Gemini 3.5 Transcribe con un lote de audios reales (reuniones, llamadas de call center) y compará el WER y, sobre todo, la calidad de la limpieza de muletillas. El WER en pregrabado de 2,6% reportado por Google es competitivo con el estado del arte.
- Definir tu lista de jerga antes de pasar a producción. El vocabulario personalizado funciona mejor cuando le das al modelo entre 50 y 500 términos clave con su ortografía canónica: nombres de productos, siglas internas, apellidos compuestos. Sin esa lista, el modelo "corregirá" términos válidos y rompe tu terminología de dominio.
- Diseñar el fallback de idioma. Aunque detecta 85 idiomas automáticamente, conviene forzar el idioma en flujos críticos (soporte técnico, transcripción médica) para evitar saltos entre dialectos parecidos (es-ES vs. es-MX, por ejemplo).
Riesgos y qué mirar de cerca
El matiz importante: el modelo no transcribe lo que dijiste, transcribe lo que quisiste decir. Eso es útil para un CRM o una nota de meeting, pero problemático para contextos donde cada palabra importa — jurídicos, médicos, declaraciones juradas. Para esos casos, conviene mantener transcripción literal + una capa opcional de edición asistida.
Tampoco está claro aún el precio en la API. Google no publicó tarifas en el anuncio inicial; conviene revisar la consola de AI Studio cuando se abra el acceso general para modelar el costo por minuto de audio frente a alternativas.
Fuentes
- Google announces Gemini 3.5 Transcribe for AI-powered speech-to-text (fuente original)
- Google's new AI transcription edits out your 'ums' and 'ahs'
- Google rolls out Gemini Audio to improve real-time dialogue and speech recognition
- Google releases three new Gemini models — but no 3.5 Pro
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














