El «cerebelo» de la IA: 18 modelos pequeños que viven en el dispositivo
Desert Ant Labs, un laboratorio europeo de IA fundada por el equipo detrás de la app de video Detail, acaba de lanzar 18 modelos on-device (12 estables y 6 en beta) que se ejecutan directamente en teléfonos, tablets y navegadores, sin pasar por la nube. El acceso es gratuito hasta 100.000 usuarios activos mensuales, sin tokens, sin login y sin envío de datos.
La tesis del laboratorio es directa: la mayoría de tareas que hoy se mandan a un LLM enorme — limpiar audio, transcribir voz, detectar un idioma, redactar datos sensibles — no necesitan un modelo frontera. Necesitan un modelo pequeño, especializado y barato, ejecutado donde ya está el usuario.
Qué hace cada modelo (y cuánto mejora a la competencia)
El catálogo inicial cubre audio, visión y texto. Cada modelo ataca una sola tarea, optimizado para correr en chips viejos. Estos son los más llamativos según los benchmarks publicados por Desert Ant:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Voz (transcripción): transcribe 10 minutos de audio en 2 segundos en un iPhone, 4,7 veces más rápido que Whisper, con marcas de inicio y fin por palabra.
- Clear (mejora de audio): un modelo de 9 MB que convierte una grabación casera de 5 minutos en audio de calidad estudio en 1 segundo. Reemplaza a Dolby en Detail, según el equipo.
- Redact (privacidad): enmascara nombres, direcciones y números de tarjeta en tiempo real en 27 idiomas, antes de que los datos lleguen al servidor.
- Tongue (detección de idioma): identifica 84 idiomas a partir de 3 palabras, con un modelo de apenas 2 MB.
- Clips (edición de video): un modelo de 284 MB que convierte un video de 10 minutos en una docena de clips en 5 segundos. Reemplaza a Claude Sonnet en Detail: 10 veces más rápido y 470 veces menos energía según las pruebas internas del laboratorio.
Los 14 modelos restantes están documentados con especificaciones y benchmarks en desertant.com/models y en Hugging Face. Todos comparten el mismo SDK, disponible en Swift, Kotlin y JavaScript — el primero corre sobre el Neural Engine del iPhone, y la versión web opera con WebAssembly.
Por qué importa: el coste real de la inferencia en la nube
El lanzamiento llega en un momento de tensión estructural para las startups que dependen de APIs de IA. La industria destinará alrededor de USD 450.000 millones a centros de datos este año, según cálculos citados por el propio laboratorio, mientras que el mundo embarca más de 1.000 millones de teléfonos, tablets y laptops con chips cada vez más capaces para tareas de inferencia ligera.
El argumento económico es directo: el cómputo ya está pagado. El dispositivo del usuario ya tiene una NPU; solo falta el modelo adecuado. Cuando la inferencia no tiene coste por llamada, se puede ejecutar en cada mensaje, en cada pulsación de tecla, en cada frame — no solo en los casos que el presupuesto permite revisar.
La tesis no es nueva, pero el laboratorio aporta datos concretos sobre dónde está el despilfarro. Según un análisis de investigadores de NVIDIA citado por Desert Ant, entre el 40% y el 70% de las llamadas de tres sistemas agénticos desmontados por la compañía podrían resolverse con un modelo pequeño y especializado en lugar de un modelo frontera.
En el terreno comparable, Superwhisper presentó a finales de agosto su línea S1, que incluye el modelo S1-mini (0,6 mil millones de parámetros) para limpieza de transcripciones en el dispositivo, junto con una versión en la nube, según reportó Slator. Es la misma dirección: dividir el trabajo entre un modelo pequeño local para el ruido de fondo y un modelo más grande para lo que realmente lo necesita.
Soberanía europea como argumento de venta (y de regulación)
Desert Ant construye todo su stack en Europa y lo presenta como una decisión de producto, no solo de marketing. «On-device» es el default soberano: los datos del cliente nunca salen del dispositivo, la funcionalidad nunca depende de la nube de un tercero, y lo que nunca se sube no puede ser compelido a entregarse.
Para founders que venden a clientes enterprise en la UE, ese posicionamiento coincide con la presión regulatoria del GDPR y con la creciente demanda de AI Act. Una función de redacción de PII ejecutada en el dispositivo convierte un problema legal complejo en una línea de código.
¿Qué significa esto para tu startup?
Si estás construyendo un producto móvil o web y pagas facturas de inferencia que no cuadran, hay tres movimientos concretos que puedes hacer esta semana:
- Audita qué llamadas a tu LLM realmente requieren un modelo frontera. Separa en dos columnas las funciones de tu producto: las que razonan, generan contenido o requieren contexto largo (clara candidata a nube) y las que clasifican, transcriben, limpian o detectan (candidatas a modelo local). El rango del 40–70% de NVIDIA es tu techo de ahorro.
- Prueba el SDK de Desert Ant en una función piloto. El tier gratuito cubre hasta 100.000 MAU, suficiente para validar en producción sin compromiso. Empieza por Redact o Tongue si manejas texto en varios idiomas: son los reemplazos más directos a llamadas que hoy pagan por token.
- Convierte la soberanía de datos en mensaje comercial. En ventas a empresas europeas, un flujo que corre 100% en el dispositivo del usuario final no es solo una optimización técnica: es un argumento de cierre frente a procurement y equipos legales.
Fuentes
- Desert Ant Labs: local, fast models that run on device (fuente original)
- Superwhisper Launches Cloud and On-Device Dictation Models — Slator
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













