Suno se mete en el terreno del text-to-speech con Speech, su primera función de voz
Suno, el generador de música con IA que saltó a la fama por crear canciones a partir de prompts de texto, lanzó Speech, una nueva función que genera voces sintéticas acompañadas —o no— de música de fondo, en beta pública en web y móvil. El movimiento marca la primera incursión formal de Suno fuera de la música y la coloca de lleno en un mercado que ya tiene un competidor dominante: ElevenLabs.
La función está disponible en los planes actuales sin coste extra durante la beta, según anunció la propia compañía. Permite elegir entre un modo Simple (describes lo que quieres, como «un capitán pirata arengando a su tripulación») y un modo Advanced con guion propio, ajustes de género, estilo de habla y variabilidad de la voz. Cada clip puede durar hasta unos ocho minutos, suficiente para un podcast corto, una narración o una pieza de audio corporativo.
Cómo funciona Speech y qué la diferencia de otras herramientas
El diferencial de Suno no está tanto en la calidad de la voz aislada —campo donde ElevenLabs, Adobe y los modelos de DeepMind llevan años trabajando—, sino en el paquete unificado. La idea es que el modelo genera voz y música como una sola pista cohesiva, no como dos elementos que después hay que mezclar en un editor.
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidadCasos de uso que la propia Suno menciona:
- Poesía o narración con banda sonora ambiental relajante.
- Voiceovers dramáticos con música épica de fondo.
- Discursos motivacionales con acompañamiento enérgico.
- Podcasts y contenido corto que necesitan coherencia tonal entre la voz y el fondo.
Un toggle permite desactivar la música y dejar solo la voz limpia. El CPO Jack Brody fue honesto sobre las limitaciones de la beta: «Ocasionalmente, los acentos británicos se van a Australia y vuelven. Las pausas dramáticas pueden ser muy dramáticas. Van a descubrir usos para esto que a nosotros ni se nos ocurrieron».
El contexto estratégico: por qué Suno necesita diversificarse
Speech no llega en el vacío. Suno está inmersa en un guerra legal con las grandes discográficas que amenaza su negocio principal. Sony Music y Universal Music Group la demandaron en 2024 alleging que entrenó con 560 obras con copyright; en mayo de 2026 ampliaron la denuncia para incluir más de 61.000 canciones adicionales, según reportó TechCrunch. Una nueva demanda de Sony y UMG del 18 de septiembre de 2026 cubre 60.202 canciones y, bajo la legislación estadounidense, podría implicar daños de hasta US$150.000 por canción, según un análisis de Note.
Mientras tanto, Warner Music Group fue la primera major en cerrar un acuerdo: settlement en noviembre de 2025 y un contrato de licencia que, según la propia Suno, permitió entrenar su modelo v6 con datos licenciados por primera vez. BMG y Believe también firmaron acuerdos.
Aun así, Suno cerró una Serie D de US$400 millones en junio de 2026, a una valoración de US$5.400 millones, liderada por Bond Capital, con IVP, Forerunner, Union Square Ventures, Alkeon y Quiet. En su Serie C, siete meses antes, había alcanzado una valoración de US$2.450 millones. Tiene más de 2 millones de suscriptores pagos y, según un análisis publicado por Note, su ARR pasó de US$200M a US$300M entre diciembre de 2025 y marzo de 2026.
En este contexto, Speech es una apuesta por diversificar antes de que la presión legal sobre la música se traduzca en restricciones operativas reales.
El competidor a batir: ElevenLabs vale US$22.000M
Si Suno entra al text-to-speech, lo hace en un mercado donde ElevenLabs ya es la marca de referencia. La empresa fundada en Londres por los polacos Mati Staniszewski y Piotr Dabkowski acaba de cerrar una oferta de venta para empleados de US$300M a una valoración de US$22.000M, según anunció Unite.ai el 30 de septiembre de 2026. Wellington y T. Rowe Price lideraron la operación, con entrada de EQT, Goldman Sachs, GIC, OTPP, Sapphire Ventures y BDT & MSD.
Esa valoración duplica la de su Serie D de febrero de 2026 (US$11.000M). En septiembre de 2025 estaba en US$6.600M y antes de eso en US$3.300M. Cifras clave reportadas por la propia ElevenLabs:
- Más de 15 millones de conversaciones por semana gestionadas por sus agentes, 3x más que en febrero.
- 55% de sus ingresos vienen ya del segmento enterprise.
- 5 de las 10 mayores tech companies del mundo usan su tecnología a diario, junto a 5 de las 10 mayores aseguradoras y 4 de las 10 mayores telecos.
- Más de 800 empleados.
La diferencia estratégica importa para un founder: ElevenLabs construyó su ventaja en la capa de agentes conversacionales empresariales (soporte, ventas, operaciones), mientras Suno llega al sector desde la generación creativa. Son aproximaciones distintas al mismo mercado.
Qué significa esto para tu startup
Si estás construyendo un producto que necesita voz —un SaaS de educación, un agente de atención al cliente, un generador de podcasts, un audiolibro automatizado— la entrada de Suno cambia el cálculo. Ya no es un mercado de un solo jugador relevante.
Acciones concretas que puedes tomar esta semana:
- Audita tu stack de voz actual. Si pagas ElevenLabs, Play.ht o un TTS de un hyperscaler, pruébalo ahora contra la beta de Suno para clips creativos donde la música de fondo sume valor. Suno aún no está pensado para voz empresarial de baja latencia; ElevenLabs sigue siendo mejor para agentes en tiempo real.
- Diseña tu caso de uso pensando en «voz + fondo» como un solo entregable. Un emprendedor con un newsletter puede generar pódcasts cortos con narración y música coherente en minutos, sin tocar un editor de audio. Es un antes y un después para creadores de contenido individuales.
- Diversifica dependencias. El riesgo legal de Suno (demandas por US$9.000M en juego, según Note) es un recordatorio de que construir sobre un único proveedor de audio IA es frágil. Mantén al menos dos alternativas en tu arquitectura y considera proveedores con datos licenciados verificables.
- Piensa en el precio de venta de tu producto final. Si tu SaaS cuesta US$30/mes y dependes de ElevenLabs enterprise, el unit economics puede romperse rápido. Compara contra APIs que ofrezcan voz y música empaquetadas para entender tu coste real por minuto entregado.
Fuentes
- The Verge – AI music maker Suno now generates spoken words
- TechCrunch – Still facing copyright lawsuits, AI music generator Suno raises another $400M
- VICE – Suno Is Now (Legally) Training AI on Licensed Music After First Lawsuit Settlement With Major Label
- Unite.ai – ElevenLabs Closes $300M Employee Tender Offer at $22B Valuation
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidad













