Un LLM razonador que cabe en la palma de la mano
PrismML presentó esta semana Bonsai 2 27B, un modelo de razonamiento que reduce el Qwen3.8 27B de Alibaba —uno de los open source más usados del momento— hasta dejarlo en 5,9 GB. Esa cifra significa que el modelo entero cabe en la RAM de un PC moderno y, según la compañía, posiblemente en la de un smartphone de gama alta. Es una reducción de 9x a 10x en memoria frente al original.
Lo llamativo no es solo el tamaño: Bonsai 2 conserva el 98% del desempeño agregado en benchmarks de Qwen, frente al 95% que alcanzó la primera versión lanzada en marzo. El modelo original ya acumula más de 11 millones de descargas y los modelos más pequeños de la casa, otros 2,6 millones, según cifras compartidas con TechCrunch.
Para una startup fundada por investigadores de Caltech y liderada por el profesor Babak Hassibi, experto en compresión, el dato de uso es tan importante como la métrica técnica: demuestra que la comunidad ya está descargando y probando estos modelos en hardware real.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadQué hace diferente a Bonsai 2
La técnica de PrismML se llama «pesos ternarios» y ataca el corazón del tamaño de un LLM. Los pesos son la información que un modelo aprende durante el entrenamiento; normalmente cada peso se almacena con 16 bits. PrismML los reduce a solo tres valores posibles: +1, −1 o 0.
Menos valores por peso significan menos espacio en disco y, sobre todo, menos memoria necesaria para mantener el modelo cargado durante la inferencia. El resultado es que un modelo razonador de 27.000 millones de parámetros se vuelve ejecutable en una laptop sin GPU dedicada.
El siguiente paso ya está en la hoja de ruta. Hassibi dijo a TechCrunch que esperan lanzar «en los próximos meses» modelos en el rango de varios cientos de miles de millones de parámetros comprimidos con la misma técnica, y que la compresión debería ser aún más eficiente en modelos grandes: «para modelos más grandes es más fácil llegar al 100% de retención de inteligencia».
El campo de juego: la apuesta por la IA en el dispositivo
PrismML no está sola. Multiverse Computing, fundada por un profesor del Donostia International Physics Center de España, levantó en julio de 2026 una Serie C de US$570 millones a valoración pre-money de US$1.700 millones, según SiliconANGLE. Su producto, CompactifAI, usa redes tensoriales de la física cuántica para reducir el tamaño de LLMs entre un 80% y un 95%, y entre sus clientes figuran Allianz, Bosch, Iberdrola, PwC y Telefónica.
La diferencia que Hassibi reivindica es la paridad de benchmarks: dice que Multiverse pierde más desempeño por cada bit recortado. La métrica de 98% en Bonsai 2 frente a modelos comparables es el argumento central de PrismML para distinguirse.
El movimiento no es aislado: la ejecución de LLMs en el dispositivo (edge AI) es uno de los campos más activos del sector. Según Computer Weekly citando datos de GM Insights, el mercado de edge AI rondaba los US$12.500 millones en 2024 y crece cerca de un 25% anual, hacia más de US$100.000 millones en 2034. Las motivaciones son técnicas (latencia, resiliencia cuando la red falla) y regulatorias: en Europa, el Cyber Resilience Act empuja a que parte del procesamiento sensible ocurra dentro del dispositivo del usuario.
Ion Stoica, cofundador de Databricks y asesor de PrismML, lo resume así: vas a tener «inteligencia al alcance de la mano, y va a ser gratis porque correrá en el dispositivo que ya compraste. También será privada, porque no la enviarás a la nube».
Qué significa esto para tu startup
La promesa operativa de Bonsai 2 no es teórica: si un modelo razonador de 27B parámetros cabe en un PC de oficina sin GPU, varios productos que hoy son inviables por coste pasan a ser construibles.
Tres acciones concretas que puedes evaluar este trimestre:
- Auditoría de privacidad por arquitectura. Si manejas datos sensibles (salud, legal, finanzas), un modelo que corre local elimina el riesgo de tránsito y almacenamiento en servidores de terceros. Empieza por mapear qué flujos de tu producto envían datos a APIs de LLM externas y cuáles podrían sustituirse por inferencia on-device con modelos como Bonsai 2.
- Coste por inferencia vs. coste por dispositivo. El modelo cloud escala el gasto con el uso; el on-device lo frontalea en hardware y aplana el coste marginal por consulta. Si tu volumen de llamadas a LLM es alto y predecible, un piloto con Bonsai 2 en laptops del equipo puede salir más barato que el equivalente en tokens de API en menos de un año.
- Producto offline-first. Sectores como construcción, manufactura, logística o fieldwork en zonas sin cobertura (minas, puertos, plantaciones) se benefician de un asistente que funcione sin internet. La compresión de 9-10x hace viable correr razonamiento complejo en handhelds industriales como el Qualcomm QCM6490, ya en uso por proveedores como Iterate.ai para modelos de más de 3.000 millones de parámetros.
El límite sigue siendo honesto: 98% no es 100%, y ciertos benchmarks importan más para casos específicos que el promedio agregado. Antes de comprometerse con un modelo on-device, cualquier founder debería medir el desempeño en sus tareas reales, no en tablas genéricas.
Fuentes
- PrismML hopes its tiny LLM could change how we all use AI — TechCrunch
- AI model compression startup Multiverse raises $570M at $1.7B valuation — SiliconANGLE
- The Edge LLM Offload Story — Semiconductor Engineering
- Edge series — Iterate.AI: Edge AI’s inference blind spot — Computer Weekly
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













