Cactus Compute lanza Whistle: STT de 16.9 MB en CPU

¿Qué es Whistle y por qué importa un modelo de 16.9 MB?

Cactus Compute presentó Whistle, un modelo de speech-to-text que cabe en un solo archivo de 16.9 MB y corre en CPU sin dependencias externas. La cifra es el dato central de la noticia: para ponerlo en contexto, Whisper base de OpenAI pesa 145.3 MB, casi 8.6 veces más, según los benchmarks publicados por el propio equipo de Cactus.

Para un founder, esto cambia la ecuación de costos y privacidad: ya no necesitas enviar audio a la nube para transcribir. Whistle procesa clips de hasta 30 segundos en inglés, alemán, francés, español, italiano, holandés y polaco — siete idiomas detectados automáticamente o forzados por parámetro — y emite el idioma detectado como un token dentro del vocabulario, no como un campo aparte.

¿Qué puede hacer Whistle en el dispositivo?

Whistle ejecuta tres tareas, todas locales y sin conexión:

Leíste lo que hace la IA. ¿Y en tu negocio?

En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.

👥 Probar 7 días
  • Transcripción: audio mono a 16 kHz, hasta 30 segundos por pasada, en los 7 idiomas mencionados.
  • Timestamps por palabra: cada palabra con inicio, fin y probabilidad, alineados desde la atención del decoder.
  • Speech embedding: el output del encoder, una fila por frame de 80 ms, sin necesidad de decodificar transcripción.

El sistema mide la loudness range del clip antes de iniciar el decoder: si está por debajo del umbral de silencio, devuelve transcripción y lenguaje vacíos sin entrar en beam search. Esto evita desperdiciar cómputo en clips mudos o ruido de fondo, un detalle relevante si piensas en usarlo en wearables o dispositivos siempre encendidos.

¿Cómo se compara con Whisper y Moonshine?

Según los benchmarks publicados por Cactus Compute, Whistle supera a Whisper base en los conjuntos LibriSpeech test-clean, test-other, SPGISpeech, Earnings-22 y el promedio FLEURS. Whisper base sigue adelante en TED-LIUM, AMI y el promedio MLS.

Los word error rates de Whistle se midieron sobre 86,174 utterances, y los de Whisper y Moonshine son las cifras publicadas por sus autores desde los checkpoints multilingües. El equipo verificó que ningún audio de prueba aparece en los datos de entrenamiento o validación de Whistle, comparando checksums e IDs de hablantes en cada set reportado.

En latencia, los números son estos:

  • 5 segundos de audio → 5.9 ms hasta el primer token
  • 10 segundos → 11.1 ms
  • 30 segundos → 36.3 ms

Whisper, al paddear toda entrada a 30 segundos, mantiene un time to first token plano independientemente del largo del clip. Whistle, en cambio, escala con la duración, pero sigue siendo competitivo en clips cortos — el caso típico de comandos de voz o notas rápidas.

¿Cómo logra Whistle ese tamaño? La arquitectura interna

Whistle comparte motor con Needle, el LLM de Cactus Compute: mismo archivo binario, mismo contenedor, misma cuantización. El modelo carga en el mismo engine C++ con la función needle_load, lo que significa que la misma binary puede correr modelos de texto, de voz, o ambos, según el archivo .cact que reciba.

El encoder tiene 8 bloques Simple Attention con 4 carriles residuales mHC y un Monarch Hadamard MLP en lugar del feed-forward tradicional. La atención no es causal: un frame a 3 segundos puede atender a uno a 12 segundos, lo que mejora la calidad en frases largas.

El decoder es el componente específico de voz. Tiene 8 bloques Laddered Simple Attention a width 512, 8 cabezas de query a 2 KV heads, queries y keys de 48 dimensiones, values de 64, convolución causal de 3 taps sobre Q, K y V, y lookups de engrama en las capas 3 y 7 sobre 18,432 slots. La parte específica de speech es una gated cross attention por capa: el decoder lee el encoder a través de x ← x + σ(g) · softmax(q̂ K̂ᵀ/√d) V, con una compuerta aprendida por capa. Esas proyecciones corren una vez cuando llega el clip y se mantienen cacheadas durante todo el decode — cinco beams cuestan cinco caches de transcripción, no cinco pasadas sobre el audio.

El vocabulario es de 8,192 text pieces más 7 language tokens, uno por idioma. La transcripción se capa a 320 tokens. El decoder es laddered: cada profundidad desde 2 capas se entrenó como un modelo propio, y --audio-depth selecciona uno al cargar. El encoder nunca se corta: corre sus 8 bloques completos a cualquier profundidad.

¿Dónde corre y cómo se integra?

El engine viene precompilado para 17 targets: macOS, Linux, Android, iOS, watchOS, Windows on ARM, RISC-V, MIPS, navegador web y un componente WASI. Cada carpeta incluye el binario needle, libneedle.a y needle.h, y carga cualquier archivo .cact que le pases.

La API de voz en C es mínima: needle_load, needle_transcribe y needle_embed. El engine no lee variables de entorno; cada comportamiento es un default compilado o un flag explícito. En Python, needle_complete toma el clip directamente, lo transcribe, lo responde contra tus tools y devuelve un único JSON con las llamadas y los campos de speech (prefijados audio_), sin que el caller manipule la transcripción. Para integrar en un proyecto:

import needle
m = needle.Whistle()
result = m.transcribe("audio.wav", word_timestamps=True)

Los pesos están en Hugging Face, el engine y sus carpetas de plataforma en Cactus-Compute/needle3, y el source en GitHub. El playground needle whistle transcribe desde el micrófono en la terminal, y needle whistle compare corre el mismo clip por Whistle, Whisper y Moonshine lado a lado con sus timings.

El contexto mayor: edge AI en 2026

Whistle no llega en el vacío. El mercado global de edge AI se proyecta a USD 143,000 millones para 2034, según Joshua David, senior director de edge project management en Red Hat, en declaraciones recogidas por InfoWorld. IDC predice que para 2027, el 80% de los CIOs recurrirá a servicios de edge de proveedores cloud para resolver la inferencia.

El movimiento de Apple en la misma dirección es la señal más clara del cambio: según MacRumors, Apple planea usar WWDC 2026 para reposicionar la IA on-device como ventaja competitiva, apoyándose en 15 años de silicio propio. La compañía estaría entrenando una versión destilada de Gemini de Google para correr en hardware Apple, y consideraría la adquisición de Liquid AI, startup enfocada en ejecución local de modelos.

Un paper de enero de 2025 en ArXiv (Quantifying Energy and Cost Benefits of Hybrid Edge Cloud) calculó que mover workloads de IA agentiva a edge puede generar ahorros de energía de hasta 75% y reducciones de costo por encima del 80% frente al procesamiento puro en nube, en condiciones modeladas.

Whistle entra en este mercado con una ventaja concreta: un modelo que cabe en la RAM de dispositivos modestos, no requiere GPU ni NPU, y se integra en el mismo motor que su LLM hermano. Según Geeky Gadgets, el Cactus Engine usa mapeo de memoria zero-copy y acceso a pesos desde storage, lo que le permite correr incluso en un iPhone 12 Pro de 2020 con apenas 2 GB de RAM. Para startups, la pregunta ya no es si la inferencia se va al edge, sino cuándo empezar a diseñar productos asumiendo que corre ahí.

¿Qué significa esto para tu startup?

Tres acciones concretas para founders que estén construyendo productos con voz o audio:

  • Evalúa STT on-device si tu producto toca audio sensible. Si trabajás en salud, legal, finanzas o cualquier vertical con datos regulados, un modelo como Whistle elimina la variable de enviar audio a un servidor de tercero. El costo de cumplimiento baja; el de infraestructura, también.
  • Mide latencia en tu caso de uso real, no en benchmarks. Whistle tarda 5.9 ms hasta el primer token en clips de 5 segundos, pero 36.3 ms en clips de 30 s. Si tu producto usa comandos de voz cortos, el número te favorece; si transcribes reuniones largas, el delta frente a Whisper se acota.
  • Aprovecha el engine unificado con Needle. Como Whistle carga en el mismo binario que el LLM Needle, puedes prototipar flujos multimodales (voz → texto → reasoning) con un solo runtime y un solo archivo de modelo. Esto reduce superficie de despliegue en wearables, robots o smart home, donde el footprint importa más que en un servidor.

El modelo está disponible en Hugging Face y el engine en GitHub. El umbral de entrada es bajo: si puedes correr un binario C++ en tu target, puedes probar Whistle.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

Leíste lo que hace la IA. ¿Y en tu negocio?

En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.

👥 Probar 7 días

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...