Bonsai 2 27B: un 27B en 5.9GB con 98% de retención

De 27B parámetros a 5.9GB: ¿qué acaba de lanzar PrismML?

PrismML presentó Bonsai 2 27B, una versión ternaria de un modelo multimodal de 27 mil millones de parámetros que ocupa 5.9GB en memoria y conserva el 98.2% del rendimiento del modelo original en precisión completa (full-precision). Frente a la primera generación de Bonsai 27B, lanzada en julio de 2026 con alrededor del 95% de retención, esta nueva entrega cierra la brecha y entra en territorio prácticamente "sin pérdidas". Para founders que hoy dependen de la nube para correr modelos medianos, cambia el cálculo de dónde y cómo desplegar IA.

¿Qué cambia respecto al Bonsai 27B original?

El primer Bonsai 27B llegó en julio de 2026 en dos variantes —una binaria de 1-bit (~3.9GB) y una ternaria de 1.58-bit con 95% de retención, según el comunicado oficial replicado por USA Today—. La nueva versión se apoya en una base más potente, Qwen3.8 27B, y mejora los indicadores en razonamiento, código, visión y tareas agénticas de larga duración.

Los números centrales de Bonsai 2 27B:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • 5.9GB de huella total, más de 9x menor que el modelo original en precisión completa.
  • 1.76 bits efectivos por peso, usando representación ternaria {-1, 0, +1} con escalado por grupo en FP16.
  • 262K tokens de ventana de contexto.
  • Multimodal texto + imagen de extremo a extremo.
  • Licencia Apache 2.0.
  • Puntuación agregada de 83.9 en el benchmark suite de PrismML.

¿Cómo se mide el "casi sin pérdidas"?

El término "near-lossless" se sostiene con un dato: el modelo retiene el 98.2% del rendimiento agregado de Qwen3.8 27B en el benchmark suite de la compañía, que cubre razonamiento, matemáticas, código, seguimiento de instrucciones, visión y uso de herramientas agénticas. PrismML destaca que las áreas más sensibles a la degradación —coding agents, sistemas de tool-use y flujos multimodales de varios pasos— son precisamente donde Bonsai 2 mantiene mejor el rendimiento.

Según Babak Hassibi, fundador y CEO de PrismML, citado por Yahoo Finance, el modelo demuestra que "los modelos potentes no tienen que estar confinados a infraestructura cloud". Ion Stoica, asesor de PrismML y profesor en UC Berkeley, añadió que si esa brecha de calidad sigue cerrándose, "puede expandir fundamentalmente dónde se pueden desplegar modelos altamente capaces".

¿Qué rendimiento tiene en hardware real?

Bonsai 2 27B está optimizado para correr de forma nativa en GPUs NVIDIA (vía CUDA) y dispositivos Apple como Mac, iPhone y iPad (vía MLX), con kernels custom de bajo bit. Los datos publicados por la compañía:

  • 143 tokens/segundo en NVIDIA GeForce RTX 5090.
  • 46.8 tokens/segundo en Apple M5 Max.
  • 0.714 mWh/token en RTX 4090, lo que lo hace 40% más eficiente que un modelo 8B corriendo en precisión completa.

Para founders, la cifra del M5 Max marca el techo esperable en workstation Apple, y el dato de RTX 4090 es la vara para comparar coste por inferencia en infraestructura propia.

¿Por qué importa para founders que construyen producto?

La compresión de bajo bit dejó de ser una curiosidad de investigación para convertirse en una palanca de producto y de unit economics. Tres implicaciones concretas:

  • Privacidad por defecto: tareas que tocan datos sensibles —documentos internos, código propietario, historiales de clientes— pueden procesarse on-device sin enviar nada a la nube. Esto reduce fricción regulatoria en sectores como salud, legal y finanzas, y abre modelos SaaS donde el cliente no quiere compartir datos con el proveedor de la API.
  • Coste por inferencia predecible: mover parte del workload a local elimina el componente variable del cobro por tokens. Para productos con alto volumen de inferencia por usuario (assistants en background, agentes que ejecutan herramientas, OCR multimodal continuo), el ahorro puede ser de uno o dos órdenes de magnitud frente a llamar a un frontier model en la nube.
  • Latencia y disponibilidad: una inferencia local elimina el round-trip a la API y sigue funcionando sin conexión. Esto importa para productos en movilidad, trabajo de campo o asistentes que deben responder en sub-segundo dentro de flujos interactivos.

¿Qué pueden hacer hoy los founders con Bonsai 2 27B?

El modelo está disponible bajo Apache 2.0, lo que permite uso comercial sin royalties. Dos acciones inmediatas:

  • Prototipar un flujo híbrido local/nube: identifica en tu producto las llamadas que son de alta frecuencia, sensibles o de baja complejidad, y reemplázalas por una inferencia local con Bonsai 2. Mantén en la nube únicamente lo que requiera un modelo frontier o conocimiento externo. Empieza midiendo coste por usuario y latencia antes y después del cambio.
  • Evaluar el trade-off de unit economics: compara el coste de servir Bonsai 2 27B on-device contra el coste de tokens en la API de un modelo equivalente. Aunque el modelo local requiera inversión inicial en hardware, el coste marginal por inferencia puede caer hasta cerca de cero, sobre todo en productos B2B donde el cliente compra o trae el dispositivo.

¿Dónde encaja esto en la tendencia de modelos locales?

Bonsai 2 se suma a una corriente más amplia: la de modelos abiertos y cuantizados que apuntan a desplazar parte del workload de razonamiento desde los hyperscalers hacia el dispositivo del usuario. La pregunta que PrismML plantea en su comunicado —cuánta inteligencia útil se entrega por unidad de memoria, cómputo y energía— es la correcta para los próximos 18 meses. Si esa curva sigue cerrándose, el despliegue de IA deja de ser sinónimo de "cloud-only" y empieza a parecerse a una decisión de arquitectura por producto, no a una restricción técnica.

Conclusión

Bonsai 2 27B no es solo una mejora incremental: es la prueba de que un modelo de 27B puede correr en local con una pérdida de calidad inferior al 2%. Para founders que hoy pagan por inferencia en la nube o evitan ciertos casos de uso por privacidad, es una señal de que el coste marginal de servir IA está a punto de reorganizarse. La decisión deja de ser "qué modelo uso" y pasa a ser "qué parte de mi producto corre dónde".

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...