xAI duplica la precisión de su transcripción de voz sin subir el precio
El 18 de septiembre de 2026, xAI presentó Grok Voice Transcribe 2.0, su nuevo modelo de speech-to-text que, según la compañía, es dos veces más preciso que la versión 1.0 y se posiciona como uno de los más exactos del mercado para audio del mundo real. La parte más agresiva del anuncio no es técnica: el precio se mantiene idéntico —US$0,10 por hora de audio en batch y US$0,20 por hora en streaming—, con diarización, timestamps y key terms incluidos sin coste extra.
Para founders y product managers hispanohablantes, el movimiento importa porque elimina una de las fricciones más comunes al construir productos con voz: pagar más por mejor precisión. Si el nuevo modelo cumple lo que xAI promete, los costes de transcripción dejan de ser la razón para elegir una alternativa peor.
¿Qué cambia frente a Grok Voice Transcribe 1.0?
Según el anuncio oficial de xAI, el nuevo modelo está construido sobre el mismo audio foundation model que alimenta Grok Voice, el sistema que hoy corre el asistente de Grok en los vehículos de Tesla, transcribe millones de horas de narración de vídeo y mueve decenas de miles de llamadas diarias de atención al cliente (en el caso concreto de Starlink, CryptoBriefing reportó que la tecnología gestiona más de 15.000 llamadas diarias a mediados de 2026).
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadEl salto más visible no está en el audio limpio de estudio, donde casi todos los modelos ya rinden bien. Está en el audio sucio del mundo real: líneas telefónicas defectuosas, voces superpuestas, acentos locales y datos críticos leídos en voz alta como números de teléfono, cuentas de correo y direcciones. xAI asegura que en su set interno de comandos cortos multilingües (19 idiomas, frases típicas de asistente de voz), la tasa de error por palabra (WER) cae de 20,6% a 6,8% frente a la versión 1.0. Esa es la métrica que más impacta a quien construye voice agents.
Además, el modelo detecta el idioma automáticamente, sigue cambios de idioma a mitad de una grabación sin cortar el audio y devuelve números, fechas, monedas y direcciones en su forma escrita —no como cifras sueltas— mediante un parámetro de formateo que, según la documentación oficial, soporta 25 idiomas entre los que están español, inglés, francés, alemán, hindi, japonés y coreano.
¿Cómo se compara con Whisper, Deepgram, ElevenLabs y Gemini?
xAI no se presenta en vacío. En sus propios gráficos internos, publicados junto al anuncio, compara Grok Voice Transcribe 2.0 contra cinco referencias del sector: Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 y Whisper Large v3, evaluados sobre cuatro sets extraídos de tráfico real: llamadas de soporte, conversaciones con Grok, credenciales habladas y comandos cortos.
En el ranking público Artificial Analysis, la compañía asegura que su nuevo modelo ocupa el primer puesto en precisión entre 32 modelos de streaming. La cobertura de Unite.ai, que reproduce y amplía el anuncio, confirma ese resultado y añade que xAI declara liderar también el set interno de telefonía en inglés a 8 kHz, la condición más común en contact centers.
Sobre precio comparativo, el anuncio de xAI no publica una tabla con tarifas de la competencia, así que cualquier cifra cruzada debe salir de fuentes externas verificadas —que no obtuvimos en esta búsqueda—. Lo que sí confirma la documentación oficial de xAI es que las integraciones existentes con la Speech-to-Text API reciben la mejora de precisión sin cambiar una línea de código, lo que elimina la barrera de migración.
El caso Loom: del audio al código sin pasar por el teclado
El ejemplo más concreto del anuncio es Loom, el producto de grabación de pantalla de Atlassian. Según xAI, el equipo de Loom evaluó Grok Voice Transcribe 2.0 frente a su solución anterior, lo encontró más preciso y migró la transcripción de toda su biblioteca de vídeos al nuevo modelo.
El flujo que destaca Sanchan Saxena, SVP de Teamwork Collection en Atlassian, en la cita recogida por xAI, es directo: grabar un plan de acción en Loom, volcar la transcripción a Cursor y dejar que el IDE escriba el código. Es decir, voz → texto → código, sin intervención humana intermedia. Para startups que documentan producto en vídeo o gestionan reuniones técnicas grabadas, ese atajo pasa de demo llamativa a feature de productividad real si la precisión se mantiene en producción.
¿Qué significa esto para tu startup?
Tres implicancias concretas para founders hispanohablantes que están integrando voz en su producto:
- Re-evaluar el proveedor actual sin coste de cambio. Si ya usas la API de speech-to-text de xAI, el upgrade es transparente: solo cambia el modelo en la request o espera a que la v1 quede deprecada "en las próximas semanas", según el anuncio oficial. Si usas Deepgram, Whisper, Google o Azure, ahora tienes un dato de referencia nuevo para renegociar precio o, al menos, para exigir SLA de WER en condiciones ruidosas.
- Diseñar para audio real, no para audio de demo. El argumento central de xAI es que la mayoría de los modelos están optimizados para audio limpio. Si tu producto se usa en coches, fábricas, calles, centros de soporte o consultas médicas con ruido de fondo, prioriza benchmarks en sets de telefonía 8 kHz y comandos cortos multilingües, que son donde el nuevo modelo muestra su mayor ventaja.
- Aprovechar el formateo en español. El parámetro de formateo oficial soporta 25 idiomas, español incluido. Esto resuelve un dolor clásico en LATAM: transcripciones donde números de teléfono, fechas (DD/MM vs MM/DD) o importes en pesos mexicanos, pesos colombianos o euros aparecen mal escritos. Si trabajas con voz en mercados hispanohablantes, vale la pena probarlo en un A/B contra tu proveedor actual.
El movimiento de xAI encaja en una tendencia más amplia: el speech-to-text dejó de ser una commoditie barata y se está convirtiendo en un campo de batalla por la precisión en audio adverso. Si la promesa de la v2 se sostiene en producción, los próximos meses traerán bajadas de precio o subidas de calidad en el resto del mercado.
Fuentes
- Grok Voice Transcribe 2.0 — xAI
- xAI Releases Grok Voice Transcribe 2.0 Speech-to-Text Model — Unite.ai
- Grok Voice launches on fal, enabling low-latency AI voice agents for developers — CryptoBriefing
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














