Google lanza Gemini 3.5 Transcribe: 70% más rápido

Google acelera la transcripción por voz con Gemini 3.5 Transcribe

Google presentó este 26 de agosto Gemini 3.5 Transcribe, un modelo de IA enfocado en speech-to-text que, según la compañía, es cerca de 70% más rápido desde que el usuario habla hasta que obtiene el texto final, y reduce la tasa de error en habla en vivo a 5,5%, frente al 7,32% de su predecesor Chirp 3. Ars Technica fue uno de los primeros en reportar el anuncio; The Verge y Android Authority ampliaron los detalles técnicos y de disponibilidad.

¿Qué hace diferente a Gemini 3.5 Transcribe?

Más allá de la métrica bruta de velocidad, el modelo introduce tres capacidades que cambian la experiencia de dictado:

  • Edición inteligente en tiempo real. El sistema elimina muletillas ("eh", "um", "este") mientras el usuario habla, y reformatea el texto para que llegue pulido en lugar de un volcado literal de lo que se dijo.
  • Vocabulario personalizado. Los desarrolladores pueden inyectar una lista de términos —jerga técnica, nombres propios, marcas— para que la transcripción respete la ortografía y no los "corrija" como errores.
  • Multilingüe y multi-hablante. Reconoce más de 85 idiomas con detección automática y puede atribuir el habla a hasta tres hablantes distintos en audio pregrabado, con marcas de tiempo a nivel de palabra.

Según Android Authority, la tasa de error por palabra (WER) se ubica en 4% para audio en streaming y 2,6% para archivos pregrabados en condiciones reales de ruido de fondo y conversaciones.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Dónde estará disponible y por qué importa a developers

Gemini 3.5 Transcribe ya está activo en Gboard con la función "Rambler" para el Pixel 11, y a partir del anuncio se expande a:

  • App de Gemini en macOS (en inglés).
  • Rambler en Android, en países e idiomas seleccionados.
  • Google AI Studio y Google Antigravity, en vista previa pública, accesible vía la API de Gemini.
  • Próximamente, Chrome para dictado en cualquier campo web.

Google también confirmó que el modelo llegará a Search Live, Gemini Live, Docs, Keep, Gmail, la plataforma Gemini Enterprise Agent Platform y la solución Gemini Enterprise for Customer Experience, según Android Authority. Esto último abre la puerta a integraciones con centros de contacto y asistentes conversacionales internos, donde la transcripción limpia ya es un cuello de botella.

Para developers hispanohablantes, la combinación de detección automática de idioma + vocabulario personalizado tiene una aplicación directa: chatbots de soporte que pasan de transcripción literal a transcripción apta para guardar en CRM sin pasar por limpieza humana.

¿Cómo se compara con Chirp 3 y con la competencia?

El salto respecto a Chirp 3 es modesto en precisión bruta (de 7,32% a 5,5% de error en vivo, reporta Google), pero relevante en velocidad y, sobre todo, en el flujo: la edición de muletillas ocurre dentro del modelo, no en un paso posterior. Eso recorta el trabajo de post-procesado y acerca la salida a algo "publicable" sin tocar.

En el contexto más amplio del sector, Google mantiene un calendario de lanzamientos muy activo: el 21 de julio lanzó Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber, según TechCrunch. En paralelo, OpenAI ha desplegado GPT-5.5 y avanza con GPT-5.6, mientras Anthropic presentó Claude Opus 4.8, Claude Sonnet 5 y expandió el acceso al modelo frontier Fable 5. La guerra de versiones ya no se mide solo en benchmarks de razonamiento: la transcripción y el audio en tiempo real son el nuevo frente.

Otro dato relevante: el modelo Gemini 3.5 Pro sigue sin lanzarse, pese a que Google lo había prometido para junio y a que, según TechCrunch, ya estaba en uso interno. Logan Kilpatrick, product lead en Google DeepMind, dijo que el equipo lo está probando con socios y que confía en lanzarlo "pronto".

¿Qué significa esto para tu startup?

Si tu producto depende de dictado, llamadas, entrevistas, notas de reunión o atención al cliente por voz, este anuncio cambia el cálculo de costos. Pasás de pagar por una transcripción cruda + un paso de limpieza a delegar ambas tareas al mismo modelo, con la API como canal de integración.

Acciones concretas que podés tomar esta semana:

  • Auditar tu pipeline actual de transcripción. Si usás Whisper, AssemblyAI o el propio Chirp 3, probá Gemini 3.5 Transcribe con un lote de audios reales (reuniones, llamadas de call center) y compará el WER y, sobre todo, la calidad de la limpieza de muletillas. El WER en pregrabado de 2,6% reportado por Google es competitivo con el estado del arte.
  • Definir tu lista de jerga antes de pasar a producción. El vocabulario personalizado funciona mejor cuando le das al modelo entre 50 y 500 términos clave con su ortografía canónica: nombres de productos, siglas internas, apellidos compuestos. Sin esa lista, el modelo "corregirá" términos válidos y rompe tu terminología de dominio.
  • Diseñar el fallback de idioma. Aunque detecta 85 idiomas automáticamente, conviene forzar el idioma en flujos críticos (soporte técnico, transcripción médica) para evitar saltos entre dialectos parecidos (es-ES vs. es-MX, por ejemplo).

Riesgos y qué mirar de cerca

El matiz importante: el modelo no transcribe lo que dijiste, transcribe lo que quisiste decir. Eso es útil para un CRM o una nota de meeting, pero problemático para contextos donde cada palabra importa — jurídicos, médicos, declaraciones juradas. Para esos casos, conviene mantener transcripción literal + una capa opcional de edición asistida.

Tampoco está claro aún el precio en la API. Google no publicó tarifas en el anuncio inicial; conviene revisar la consola de AI Studio cuando se abra el acceso general para modelar el costo por minuto de audio frente a alternativas.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...