Hindi, primer idioma del Sur Global en el Open ASR Leaderboard

Por qué el hindi cambia lo que mide un leaderboard de voz

El Open ASR Leaderboard de Hugging Face llevaba años evaluando modelos de reconocimiento automático del habla (ASR, por sus siglas en inglés) sobre un conjunto de idiomas centrados en Europa. Hasta ahora, los hablantes del Sur Global eran invisibles en su métrica principal. El blog publicado por Hugging Face el 28 de agosto de 2026 anuncia la incorporación de dos nuevos sets de evaluación —Monsoon en-IN (inglés indio) y Monsoon hi-IN (hindi)— que se convierten en la primera muestra del Sur Global en un ranking que la comunidad ya consulta para decidir qué modelos adoptar e iterar.

El dato de fondo: las tasas de error de los ASR no se distribuyen de forma pareja entre los usuarios. La nota de Hugging Face cita una línea de investigación previa según la cual los sistemas comerciales eran "aproximadamente el doble de malos" para hablantes negros que para hablantes blancos, además de diferencias adicionales por género, edad y acento. Ese sesgo no se ve en un leaderboard clásico, no porque lo oculte, sino porque los test sets con los que se evalúa registran qué se dijo y casi nada sobre quién lo dijo.

Qué es Monsoon y qué lo hace distinto

Monsoon es un test set construido para variar a lo largo de nueve ejes: geografía, edad, género, vocabulario, dispositivos, entornos acústicos, tipo de habla, velocidad de habla y existencia de transcripciones alternativas válidas para el mismo audio. Cada eje es una forma en la que una métrica agregada —el clásico WER, Word Error Rate— puede dar la media correcta y equivocarse con un subgrupo concreto.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Los cuatro splits del set, según publica Hugging Face en su blog, son:

  • Monsoon en-IN público: inglés indio, 5,62 horas, 1.444 hablantes, 428 distritos, 30 estados/UTs, 556 dispositivos.
  • Monsoon en-IN privado: inglés indio, 5,58 horas, 1.405 hablantes, 420 distritos, 560 dispositivos.
  • Monsoon hi-IN público: hindi, 1,33 horas, 468 hablantes, 202 distritos, 315 dispositivos.
  • Monsoon hi-IN privado: hindi, 4,47 horas, 1.571 hablantes, 295 distritos, 582 dispositivos.

En total, 4.888 hablantes con 12 atributos registrados por clip (género, fecha de nacimiento, ocupación, formación, estado civil, ingreso, distrito nativo, estado nativo, ciudad actual, años en el distrito actual, fabricante y modelo de dispositivo). Cada clip incluye, además del audio y la transcripción, un identificador y la duración. Es, en palabras del equipo de Hugging Face, "pequeño medido en horas y grande medido en hablantes".

Cómo se grabaron 4.888 voces en 428 distritos

El método sigue a la pregunta que el set busca responder: si quieres exponer variaciones entre regiones, dispositivos y hablantes, necesitas reclutar a lo ancho y no a lo largo. La recolección se apoyó en la comunidad Voice Arena, una plataforma global cuya huella llega a distritos rurales y semiurbanos que rara vez aparecen en corpus de habla. Los colaboradores grabaron conversaciones espontáneas de dos personas por canal dual, con sus propios teléfonos y sus propias conexiones —muchas en dispositivos de gama baja con ancho de banda inestable—, dentro y fuera de casa. Esa condición ruidosa no se filtra: se conserva como parte del audio.

Cada conversación se sembró con un tema abierto (viajes, salud, agricultura, educación, servicios digitales) y preguntas de seguimiento reveladas progresivamente, guiadas por lingüistas nativos que revisaron y localizaron candidatos generados por grandes modelos de lenguaje. Antes de transcribir se aplicaron filtros: identificación de idioma, verificación de género frente al autorreporte, detección de audio pregrabado o reproducido, estimación de SNR, segmentación por voz y un chequeo DNSMOS P.808. La transcripción final la hicieron lingüistas nativos en cinco rondas, con separación estricta de tareas para que nadie auditara su propio output.

Lo que Monsoon ya dejó ver: dos modelos empatados que se diferencian por zona

La nota de Hugging Face corre un ejemplo sobre el split público de inglés indio con ocho modelos del leaderboard que caen entre 4,81 y 4,99 WER —apenas 0,18 puntos del mejor al peor, dentro del margen que cinco horas de audio permiten resolver. Ordenados por el corpus, son el mismo modelo.

Cuando se agrupa a los hablantes por zona (la agrupación del Ministry of Home Affairs, con cinco zonas bien muestreadas), el ranking se desmorona. Según los datos publicados en el blog de Hugging Face:

  • openai/whisper-large-v3-turbo varía 0,46 puntos entre zonas.
  • mistralai/Voxtral-Mini-3B-2507, a solo 0,14 puntos detrás en el corpus, varía 1,68 puntos: anota 4,38 en la zona Central contra 6,06 en la Este.

Dos sistemas que el leaderboard considera indistinguibles difieren casi cuatro veces en cuánto depende su exactitud de dónde habla el usuario. Peor: qué zona es la más difícil no está fijado. ibm-granite/granite-speech-3.3-2b rinde peor en el Norte, microsoft/VibeVoice-ASR-HF en el Sur, Voxtral-Mini-3B-2507 en el Este. Si una sola región fuese intrínsecamente más difícil de transcribir, todos los modelos rankearían las zonas igual. No lo hacen, lo que apunta a los modelos, no al audio.

Por qué el hindi necesitaba su propio WER (OIWER)

La variación ortográfica del inglés tiene límites: británico contra americano, puntuación, mayúsculas, dígitos contra palabras. Un normalizador lo resuelve. El hindi no. El habla cotidiana mezcla código con inglés, las palabras de origen inglés no tienen una grafía devanagari fijada y los compuestos se escriben juntos o separados según preferencia. Una misma frase puede tener diez o más formas escritas válidas y no existe un mapeo canónico que las colapse.

Evaluado con una referencia única, el WER premia al sistema por reproducir la ortografía que eligió el anotador. Dos sistemas que reconocieron el audio igual de bien pueden diferir en varios puntos solo por la grafía. Para hindi, la nota adopta el Orthographically-Informed Word Error Rate (OIWER), introducido por AI4Bharat: en cada tramo del transcript, se acepta como correcto cualquier variante admitida en un lattice validado por lingüistas. Así solo se penalizan errores de reconocimiento genuinos.

Hugging Face también publica voi-oiwer, la implementación open source para reproducir los resultados. Al comparar el mismo sistema contra el lattice y contra una referencia aplanada a una sola variante, los rankings cambian: hay pares de modelos que invierten su orden, porque bajo una referencia única se estaba premiando, en parte, reproducir la ortografía del anotador.

Qué significa esto para tu startup

Si construyes productos con voz —callbots, agentes telefónicos, transcripción de reuniones, accesibilidad— y vendes en LATAM, España, India, África o el sudeste asiático, este movimiento te afecta en tres frentes:

  • Tu benchmark actual probablemente está sesgado hacia el inglés americano o europeo. Eso significa que tu WER en producción puede ser peor de lo que reporta el leaderboard, sobre todo con hablantes no nativos, acentos regionales o dispositivos de gama baja. Antes de elegir proveedor de ASR, pídele el breakdown por acento, dispositivo y banda de ingreso, no solo la media.
  • Empezá a probar con datos propios que se parezcan a tu usuario real. La metodología de Monsoon (muchos hablantes, sesiones cortas, dispositivos reales) es replicable. Un test interno con 50–100 hablantes representativos de tu mercado te dice más sobre tu producto que cualquier ranking público.
  • El hindi necesitó su propia métrica. Si tu mercado habla español de México, español neutro, portugués de Brasil, árabe dialectal o quechua, vas a chocar con la misma pared: la ortografía y la fonética de cada variante no se evalúan con WER agregado. Considera construir lattices de variantes válidas o medir por subgrupos, como hace ahora el leaderboard.

Dos acciones concretas para esta semana:

  • Si estás integrando un ASR comercial, mide tu WER desagregado por dispositivo y por acento en una muestra de 30–60 audios reales de tus usuarios. Es trabajo manual, pero te saca de la zona ciega que el leaderboard exhibió.
  • Si trabajas con hindi, bengalí, tamil u otro idioma del Sur Global, evalúa con OIWER o un método equivalente antes de firmar un SLA. El WER clásico puede esconder varios puntos de penalización ortográfica.

Conclusión

Monsoon no "arregla" el sesgo del reconocimiento de voz; lo hace visible. Sube a un ranking que la comunidad ya mira, dos idiomas con más de 600 millones de hablantes potenciales entre los dos y un nivel de metadatos por clip que permite descomponer el error en lugar de tragarlo en una sola cifra. Para founders hispanohablantes que llevan voz a mercados emergentes, el mensaje es directo: si tu modelo no se probó con voces parecidas a las de tu usuario, no lo des por bueno.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...