Gemini 3.5 Transcribe: la API de voz de Google para devs

Google mete más IA en el micrófono: qué es Gemini 3.5 Transcribe

Google acaba de abrir a desarrolladores Gemini 3.5 Transcribe, un modelo especializado de voz a texto que promete entender el habla tal y como la usamos en la calle: con titubeos, correcciones a mitad de frase («quedamos el martes — no, el miércoles»), acentos regionales y jerga técnica de cada industria. No es solo un motor de transcripción: Google lo presenta como una capa de "transcripción inteligente" que limpia el audio en bruto y lo entrega listo para un agente de voz, una herramienta de subtitulado o un pipeline de analítica post-llamada.

El movimiento llega en pleno boom de los agentes conversacionales por voz, donde la transcripción es el cuello de botella silencioso: si el texto que entra al LLM está sucio, todo lo que viene después falla. Con esta release, Google intenta poner su modelo directamente en manos de los equipos de producto.

Qué trae de nuevo frente a Chirp 3

Según Google, 3.5 Transcribe es el salto más fuerte en su pila de voz desde Chirp 3 (su modelo de transcripción previo, lanzado en 2025). Los números que cita, medidos por Artificial Analysis:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Word Error Rate (WER) promedio del 4,0% en modo streaming y 2,6% en no-streaming.
  • 70% menos de tiempo hasta obtener la transcripción final comparada con Chirp 3.
  • En el benchmark multilingüe FLEURS, alcanza un WER del 5,50% en streaming y 5,04% en no-streaming en un set de idiomas principales.
  • Ars Technica sitúa el WER en streaming de Chirp 3 en torno al 7,32%, lo que da una idea de la mejora relativa.

El cambio cualitativo es igual de relevante: el modelo no se limita a transcribir palabra por palabra. Aplica "smart transcription", un modo que:

  • Elimina muletillas ("eh", "mmm", "o sea") y falsos inicios.
  • Resuelve autocorrecciones habladas en tiempo real.
  • Aplica formato automático al texto resultante.
  • Reconoce vocabulario personalizado: hasta 1.000 términos según la documentación, con mejores resultados en torno a 100 (tickers, marcas, jerga médica o legal, SKUs internos…).
  • Detecta automáticamente entre más de 85 idiomas y dialects regionales, sin tener que configurar nada.
  • Identifica hablantes en audio pregrabado con atribución por speaker (hasta 3 con precisión; soporte experimental para más).

Para los fundadores que ya construyen sobre Whisper de OpenAI o sobre Deepgram/AssemblyAI, la pregunta natural es: ¿me cambio? La respuesta corta: depende de si tu prioridad es latencia sub-segundo, soporte multilingüe masivo o control fino sobre el texto. La larga, abajo.

Cómo se accede a la API: dos endpoints, no uno

Un detalle que a menudo se pierde en la nota principal: 3.5 Transcribe no se ofrece como una sola API, sino como dos endpoints separados con capacidades y límites distintos. Conviene entenderlo antes de elegir.

1. Live API (gemini-3.5-transcribe-live)

  • Streaming bidireccional continuo con latencia sub-segundo.
  • Diseñada para agentes de voz interactivos y subtitulado en tiempo real.
  • Acepta audio PCM de 16 bits, 16 kHz mono, en chunks de 100 ms.
  • Soporta detección de actividad de voz automática, híbrida o manual.
  • Límite de 10 minutos por sesión continua.
  • No ofrece diarización de hablantes ni timestamps por palabra.

2. Interactions API (gemini-3.5-transcribe)

  • Pensada para audio pregrabado: reuniones, llamadas de soporte, logs de contact center.
  • Incluye atribución de hablantes, timestamps por palabra y soporte para vocabulario personalizado.
  • Acepta hasta 1 hora de audio por request, o 30 minutos si activas diarización o timestamps.
  • Trade-off: activar timestamps por palabra puede reducir algo la precisión global.

Hay además dos modos de transcripción elegibles: verbatim (mantiene muletillas y errores tal cual, útil para auditoría legal o médica) y smart (limpia y formatea). Importante: smart no se puede combinar con diarización ni timestamps por palabra, así que hay que decidir entre legibilidad o trazabilidad.

Dónde se usa ya dentro de Google

El modelo no llega de cero: lleva meses corriendo en producción dentro de productos de Google, y eso importa porque significa que la versión para desarrolladores ya está "endurecida".

  • Gboard (Android): alimenta la función Rambler, que dicta y formatea con la voz, y permite editar, corregir y cambiar de estilo hablando.
  • Google Antigravity: usa el modelo en la caja de prompt del editor, combinando el audio con el contexto de pantalla y el historial del chat para transcribir con precisión nombres de archivo, documentos activos y pensamientos del agente.
  • Google AI Studio (modo Build): permite "vibe codear" aplicaciones dictando instrucciones en voz alta.
  • Gemini app en macOS: transcribe el habla natural y dispara function calls a otros modelos Gemini (resumir archivos, generar imágenes, reescribir texto en otras apps) usando solo la voz. Aquí es donde se ve el patrón de "transcripción + delegación": el modelo de voz no intenta hacerlo todo, llama a otros Gemini por detrás.
  • Chrome (próximamente): dictado por voz en cualquier campo web — respuestas, posts, prompts a Gemini.

Plataformas y empresas que ya lo integraron

Google publicó una lista de integraciones con su Live API que vale la pena mirar si estás eligiendo stack:

  • LiveKit, Pipecat, Agora, Fishjam, Vercel y Vision Agents son las plataformas de infraestructura de medios en tiempo real que ya soportan el modelo. Manejan el streaming de audio para que el desarrollador no tenga que tocar WebRTC ni edge networking.
  • En el lado de producto, vivo, Intellitek Health y Lingopal compartieron feedback público destacando latencia, precisión y cobertura de idiomas.

Si tu startup está construyendo sobre LiveKit o Pipecat, el cambio a 3.5 Transcribe puede ser cuestión de cambiar un parámetro. Si vienes de Twilio o de un stack propietario, el costo de migración es otro tema.

Qué significa esto para tu startup

Más allá del benchmark, lo interesante es el posicionamiento estratégico. Google está empujando un modelo donde la transcripción es la interfaz de voz: no se trata de pasar audio a texto y luego rezar, sino de entregar texto limpio, contextual y con capacidad de disparar acciones. Para founders, eso cambia tres cosas:

  • El costo de construir un agente de voz baja drásticamente. Lo que hace dos años era un proyecto de 6 meses con Whisper + heurísticas + post-procesado, hoy es un endpoint de API.
  • La batalla por la capa de voz se intensifica. OpenAI con Whisper y Realtime API, Deepgram, AssemblyAI, AWS Transcribe, Azure Speech y ahora Google con dos endpoints diferenciados. El proveedor que ofrezca menor WER + menor latencia + mejor multilingüe se va a llevar una capa crítica del stack de IA.
  • El "voice-first" deja de ser un PowerPoint. Con Rambler en Android y el dictado por voz llegando a Chrome, la voz se vuelve un input de primera clase en productos de consumo. Si tu app asume teclado, vas a sentirlo.

Acciones concretas que puedes tomar esta semana

  • Si ya tienes un agente de voz en producción, evalúa migrar el endpoint de transcripción a la Interactions API para audio pregrabado (reuniones, llamadas) y mantén la Live API para interacción en tiempo real. Empieza con un A/B test de WER sobre 100 muestras reales de tu producto antes de migrar todo.
  • Si estás diseñando un producto para mercados hispanohablantes, el soporte de 85+ idiomas con detección automática es una oportunidad: permite entrar a México, Colombia, Argentina y España con el mismo pipeline. El detalle a probar es el rendimiento con acentos regionales fuertes (andino, rioplatense, canario) — los benchmarks de FLEURS no siempre capturan el campo.
  • Si construyes sobre LiveKit, Pipecat o Agora, la integración debería ser de horas, no de semanas. Útil para startups que quieren lanzar features de voz sin contratar audio engineers.
  • Si tu modelo de negocio depende de transcripciones auditables (legal, salud, compliance), considera el modo verbatim en la Interactions API y mantén timestamps por palabra. Vas a renunciar a la limpieza automática, pero ganas trazabilidad — algo que un regulador te va a pedir tarde o temprano.
  • Si vendes a contact centers, la combinación diarización + vocabulario personalizado (1.000 términos) + 1 hora de audio por request es exactamente lo que estos clientes necesitan para automatizar QA de llamadas sin reescribir cada marca propia.

Lo que falta saber (y por qué importa)

Google no publicó precios detallados por minuto de audio para 3.5 Transcribe en el anuncio, ni comparativa de coste por token frente a Chirp 3. Tampoco se conoce la lista completa de regiones donde estará disponible la versión enterprise (Gemini Enterprise for Customer Experience) ni los SLAs del public preview. Para una decisión de adopción seria, esos tres datos son los que terminan inclinando la balanza. Estaremos pendientes de la documentación de precios en Google AI Studio para actualizar este análisis.

Tampoco hay comparativa directa publicada con Whisper de OpenAI, Deepgram Nova-3 o AssemblyAI Universal-2 en idénticas condiciones. Hasta que esa comparativa aparezca — idealmente de un tercero中立 como Artificial Analysis o un benchmark independiente — el "2,6% WER" hay que leerlo como "el número que Google presenta cuando mide con su metodología".

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...