BITCOS: el layout que rompe el límite teórico de 1.58 bits
Un nuevo paper de arXiv presenta BITCOS, un esquema de almacenamiento para LLMs ternarios que baja el coste por peso por debajo del suelo teórico de log₂(3) ≈ 1.585 bits. En los modelos más dispersos llega a 1.485 bits por peso y mejora el throughput de inferencia hasta 1.27× en GPU y 1.18× en CPU frente a los kernels de producción actuales.
La idea es simple pero potente: la barrera de 1.58 bits es un límite informacional que asume que los tres símbolos {-1, 0, +1} son equiprobables. Los autores midieron 29 modelos ternarios reales y encontraron que los ceros representan hasta el 51.5% de los pesos. Aprovechar esa distribución real —no la teórica— permite comprimir más sin perder información.
Por qué los ceros importan más de lo que parece
En un LLM ternario cada peso vale -1, 0 o +1. El formato de despliegue dominante (el five-trit packing usado por bitnet.cpp de Microsoft) mete cinco pesos en un byte, pero por los tamaños de grupo en potencias de dos termina costando 1.625 bits por peso — más que el óptimo teórico.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadEl paper introduce un diseño distribution-adaptive: un bitmap de presencia que dice "aquí hay un cero o aquí hay un signo" y, donde hay signo, un vector compacto con sólo el +1 o el -1. La fórmula resultante es 2 − z bits por peso, donde z es la densidad de ceros del modelo.
Resultado sobre los 29 modelos evaluados:
- 26 de 29 se comprimen mejor que con five-trit packing.
- En el más disperso, 1.485 bits por peso — por debajo del límite de 1.585.
- Ganancia realizada en matrix-vector multiplication de hasta 1.28× frente a los kernels SOTA de producción.
Cómo se acelera la inferencia en hardware real
BITCOS no es sólo una mejora teórica: el paper publica secuencias de unpacking optimizadas para AVX-512, AVX2 e Intel Xe2 GPUs, las tres familias más usadas en centros de datos y dispositivos edge.
En pruebas end-to-end de inferencia de LLM, midieron el impacto en 5 plataformas distintas (CPU de servidor, CPU cliente, GPU integrada Xe2, GPU discreta Xe2 y otra adicional):
- CPU: hasta 1.18× más tokens/segundo en decode.
- GPU: hasta 1.27× más tokens/segundo en decode.
Para un founder que corre inferencia on-device o en instancias cloud, ese margen se traduce directamente en menos GPUs por запрос o en aceptar más usuarios con el mismo hardware.
Contexto: BitNet b1.58 ya es un estándar de facto
BITCOS no llega solo. El ecosistema de LLMs a 1.58 bits tiene ya tracción relevante, según el repositorio oficial de Microsoft:
- BitNet-b1.58-2B-4T (abril de 2025) es el primer modelo oficial entrenado con 4 billones de tokens.
- bitnet.cpp ofrece speedups de 2.37×–6.17× sobre x86 y 1.37×–5.07× sobre ARM frente a modelos full-precision, con reducciones de energía de hasta 82.2%.
- En julio de 2026 Microsoft publicó BitNet-embedding-0.6B y BitNet-embedding-270M, los primeros modelos de embeddings 1-bit con calidad competitiva.
- El paper fundacional "The Era of 1-bit LLMs" (Ma et al., febrero de 2024) es la base teórica.
Un paper paralelo de abril de 2026 sobre aceleradores hardware basados en lookup tables (LUT) para inferencia 1.58-bit reporta reducciones de área de 2.2× frente a baselines con multiplicadores —señal de que el stack entero (algoritmo + layout + silicio) se está moviendo a la vez.
¿Qué significa esto para tu startup?
Si tu producto depende de correr LLMs —chat, RAG, agentes, embeddings— el camino ternario está madurando más rápido de lo que parece. Algunas palancas accionables:
- Evalúa BitNet b1.58 como reemplazo drop-in para cargas donde el modelo completo (7B, 70B) es overkill. La familia Falcon3-1B/3B/7B/10B-Instruct-1.58bit de TII ya está en Hugging Face, y bitnet.cpp los soporta con kernels optimizados. Útil si haces on-device AI o inferencia sensible a coste en CPU.
- Prototipa con el kernel oficial antes de pagar GPUs caras. El repo de Microsoft muestra que un modelo 100B puede correr en una sola CPU a 5–7 tokens/segundo, suficiente para muchas herramientas internas de back-office.
- Espera a la integración upstream. BITCOS aún es un paper. Cuando aterrice en bitnet.cpp o en un fork como llama.cpp, el cambio en coste por token será inmediato para quien ya use el stack.
- Para fundadores en LATAM y España, donde el coste de GPU cloud pesa más en el unit economics, reducir el peso por token de 1.625 a 1.485 bits (un 8.6%) sin perder calidad cambia la cuenta de margen en modelos con mucho tráfico.
La barrera de 1.58 bits era teórica. BITCOS demuestra que, en práctica, los LLMs reales tienen estructura que un layout listo puede exprimir —y que el límite real lo pone la distribución observada, no la información.
Fuentes
- Breaking the 1.58-bit Barrier for Ternary LLMs (fuente original)
- microsoft/BitNet — Official inference framework for 1-bit LLMs
- Hardware Generation and Exploration of Lookup Table-Based Accelerators for 1.58-bit LLM Inference
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













