Una ronda para escuchar lo que la transcripción no cuenta
La startup de Boston Modulate anunció el 28 de septiembre una ronda de US$25 millones liderada por Future Ventures, con la participación de los inversores existentes Hyperplane y Lakestar. El capital, que según el comunicado de la empresa eleva el financiamiento acumulado a US$60 millones, se destinará a expandir una plataforma de inteligencia artificial que analiza el audio crudo de las conversaciones, no solo su texto. Para un founder que esté montando atención al cliente con agentes de IA o productos de voz, la apuesta tiene una lectura clara: la transcripción por sí sola ya no alcanza.
Por qué analizar el audio y no solo las palabras
La plataforma insignia de Modulate se llama Velma y trabaja sobre el audio crudo de la llamada, en lugar de pasar primero por un sistema de texto. Bajo la superficie opera lo que la empresa llama arquitectura Ensemble Listening Model: un orquestador que elige entre más de 100 modelos pequeños especializados según la tarea y combina sus resultados. Modulate afirma que este enfoque es hasta 1.000 veces más eficiente que pasar todo el audio por un único modelo grande, según reportó SiliconANGLE.
Los modelos se dividen en dos familias, según explicó el cofundador y director ejecutivo Carter Huffman a TechCrunch. La primera extrae señales: emoción, tono, idioma y si la voz es sintética. La segunda, de análisis y detección, interpreta intención: si el cliente está por colgar, si el agente cumple una política regulatoria o si la llamada pinta a fraude. Parte del análisis corre en tiempo real, mientras la conversación sigue en marcha, lo que permite intervenir antes de que la llamada termine mal.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLa transcripción es insuficiente porque, como explicó Huffman a TechCrunch, una persona puede ser cortés con un bot de IA y aun así quedar insatisfecha. La transcripción pierde esa capa; el modelo de audio la recupera. Esa diferencia es la que la empresa vende a centros de atención, supervisores de fraude y, cada vez más, equipos que monitorean agentes de voz automatizados.
Las cifras que respaldan la tracción
Modulate asegura que sus modelos procesan más de 10 millones de horas de audio al mes y que ya superaron las 600 millones de horas acumuladas. La escala mensual, reportada por SiliconANGLE y CryptoBriefing, es parte central del pitch comercial: operar a ese volumen permite entrenar continuamente y mantener latencias bajas.
En el lado de benchmarks públicos, dos productos de la compañía ocupan el primer puesto en sus respectivos leaderboards de Hugging Face en 2026:
- El modelo de transcripción lidera el Open ASR Leaderboard desde julio de 2026.
- Velma Deepfake Detect, lanzado en marzo de 2026, está primero en el Speech Deepfake Arena, con una precisión declarada del 98,9% sobre datos públicos de referencia y una tasa de error igual reportada del 1,1%, según CryptoBriefing.
Los precios de la API ya están publicados, lo que sirve de referencia para cualquier founder que esté calculando costos de integrar este tipo de tecnología. Según SiliconANGLE y CryptoBriefing:
- Transcripción por lotes: US$0,03 por hora de audio.
- Detección de deepfakes por API: US$0,25 por hora de audio.
Son tarifas lo suficientemente bajas como para que el análisis de voz empiece a entrar en la categoría de coste operativo, no de proyecto piloto.
Del gaming a la salud y los call centers
Modulate nació en 2017 de la mano de Carter Huffman y Mike Pappas, ambos físicos egresados del MIT, según TechCrunch y SiliconANGLE. Su primer producto fueron moduladores de voz para videojuegos, lo que explica un detalle curioso: la base instalada original estaba en chats de voz de juegos online, donde el problema era moderar acoso y grooming. De ahí viene ToxMod, su herramienta de moderación, que se usa en Call of Duty desde 2023 según la cobertura original de FomoEra.
El giro hacia la empresa ocurrió cuando la generación de audio por IA se volvió trivial. Hoy los clientes de Modulate se reparten en tres verticales, según TechCrunch y SiliconANGLE:
- Centros de atención al cliente que necesitan detectar llamadas de estafa y medir la calidad de sus agentes de IA.
- Instituciones de salud que filtran intentos de suplantación mediante voces sintéticas.
- Plataformas de social y gaming que siguen usando ToxMod para moderación.
La plantilla actual, según TechCrunch, es de 40 a 45 personas y la empresa prevé contratar unas 10 más en los próximos meses, enfocadas en investigación, ingeniería y developer relations. También está invirtiendo en despliegue on-premises y on-device para responder a clientes regulados que no pueden mandar audio a la nube.
El cap table y lo que dice el precio implícito
Antes de esta ronda, según datos de PitchBook citados por TechCrunch y CryptoBriefing, Modulate había levantado US$41 millones a una valoración de US$170 millones. La trayectoria de los inversores ayuda a entender por qué Future Ventures lidera ahora:
- Hyperplane fue el primer inversor institucional y participó en la ronda semilla de US$2 millones, según SiliconANGLE.
- Lakestar lideró la Serie A de US$30 millones en 2022, según SiliconANGLE.
Steve Jurvetson, cofundador de Future Ventures, justificó la entrada con un argumento que aplica a cualquier founder que mire el sector: Modulate, dijo, "ha ganado una ventaja técnica significativa en audio-nativo AI" y la necesidad de esa tecnología se está extendiendo más allá de donde empezó.
Qué significa esto para tu startup
La señal de mercado es clara: los inversores están apostando a que la voz sea una de las interfaces primarias de la IA, y eso crea una capa nueva de problemas que una transcripción no resuelve. Para un founder que esté construyendo producto, hay tres movimientos prácticos que esta ronda hace urgentes:
- Si operas o vendes a call centers, empieza a mirar el audio, no solo el texto. Las métricas tradicionales (CSAT derivado de transcripciones, sentiment básico) ya muestran el agujero que Huffman describe: clientes educados que abandonan. Considera integrar APIs como la de Modulate o construir tu propio pipeline de señales de audio.
- Si construyes agentes de IA por voz, planifica el fraude desde el día uno. Clonar voces ya es trivial. En flujos de fintech, salud o cualquier operación que requiera verificación por voz, una capa de detección de deepfake barata (US$0,25 por hora) empieza a tener sentido como coste de operación, no como feature opcional.
- Estudia la arquitectura de "modelos pequeños en ensemble". La tesis de Modulate es que, para tareas especializadas de audio, muchos modelos pequeños coordinados por un orquestador ganan en eficiencia y costo al monolito grande. Si tu producto tiene un cuello de botella en inferencia de voz, este patrón vale como referencia.
El espacio está madurando rápido: a los precios que Modulate y sus competidores están publicando, el coste por hora de análisis de voz empieza a ser lo suficientemente bajo para incorporarlo como coste operativo, no como proyecto piloto.
Fuentes
- Modulate levanta US$25 millones para analizar la voz más allá de las palabras - FomoEra
- Modulate raises $25M for its voice models and analysis suite - TechCrunch
- Voice AI startup Modulate raises $25M to bring audio-native models to more developers - SiliconANGLE
- Modulate raises $25M to advance deepfake detection with audio-native AI platform - CryptoBriefing
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














