Liquid AI recupera 97% de la calidad BF16 al cuantizar LFM2.5 con un método nuevo
Liquid AI publicó el 19 de agosto de 2026 los checkpoints QAD Q40 de su familia LFM2.5 — versiones de 4 bits entrenadas con Quantization-Aware Distillation (QAD), una técnica que destila un modelo profesor en alta precisión hacia un estudiante ya cuantizado. El resultado, según la propia compañía, es que los modelos retienen 97,1%, 96,5%, 97,4% y 96,6% de su rendimiento BF16 original sobre razonamiento, seguimiento de instrucciones, uso de herramientas y tareas agénticas, manteniendo el mismo tamaño de memoria y velocidad de un Q40 nativo.
Los modelos actualizados son LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct y LFM2.5-2.6B, todos disponibles como archivos GGUF en Hugging Face. Para un founder hispanohablante, la cifra clave es la recuperación del 97%: durante años la cuantización agresiva implicaba aceptar caídas de calidad visibles, y ahora esa penalización práctica desaparece para los modelos pequeños de Liquid.
¿Qué es Quantization-Aware Distillation y por qué importa?
La cuantización tradicional post-entrenamiento (PTQ) comprime los pesos de un modelo ya entrenado a menor precisión, lo que suele costar entre un 3% y un 8% de accuracy. QAD invierte el orden: primero se entrena al modelo estudiante ya en 4 bits, usando como profesor un modelo en BF16, de modo que el estudiante aprende a comportarse como el profesor pese a la cuantización.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadEn la práctica, esto significa que un LFM2.5-350M QAD Q4_0:
- Alcanza calidad comparable a Q5KM con un 4–33% más de throughput de decodificación.
- Un LFM2.5-1.2B-Instruct o 2.6B QAD Q40 iguala la calidad de Q4K_M con un 3–14% más de throughput.
- Iguala, donde aplica, a los checkpoints UD-Q4KXL de Unsloth, una referencia externa fuerte en PTQ.
Las pruebas de velocidad se ejecutaron en hardware edge real: MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra y Raspberry Pi 5 — los dos primeros en GPU, los dos últimos en CPU Arm.
Qué modelos se actualizaron y qué cambia para el desarrollador
Los cuatro checkpoints actualizados cubren el rango completo de la familia LFM2.5 que Liquid AI ha consolidado en los últimos meses. LFM2.5-230M, lanzado el 25 de junio de 2026, es el modelo más pequeño y según VentureBeat supera a modelos 4× más grandes en extracción de datos, con 213 tokens/s en un Galaxy S25 Ultra y 42 tokens/s en una Raspberry Pi 5. LFM2.5-VL-3B, anunciado el 12 de agosto de 2026, extendió la familia a visión-lenguaje con 3,1B parámetros y soporte para 16 idiomas, según Unite.AI. Los QAD Q4_0 aplican la misma lógica de eficiencia al lado de inferencia local.
El uso es directo: cualquier runtime compatible con GGUF Q4_0 los consume. El snippet publicado en el blog es:
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"
No hay cambio de pipeline: quien ya ejecutaba los GGUF nativos ahora puede actualizarse y recuperar calidad sin mover el resto de su stack.
¿Qué significa esto para tu startup?
Si tu producto corre un LLM en el dispositivo del usuario — un asistente en una app móvil, un copilot en una Raspberry Pi, un agente embebido en un robot — el anuncio cambia tres ecuaciones reales:
- Coste de inferencia: ejecutar en local deja de pagar por tokens de API. Para founders con productos de consumo, el ahorro de un modelo Q4_0 vs. una llamada a GPT-5.5 o Claude Opus 4.7 suele ser de uno o dos órdenes de magnitud por usuario activo.
- Latencia: eliminar el round-trip a la nube permite UX en tiempo real, clave para asistentes conversacionales, OCR en vivo o robots. El blog menciona throughput sostenido en una sola GPU suficiente para casi mil millones de tokens de salida por día.
- Privacidad y soberanía: los datos del usuario nunca salen del dispositivo, lo que simplifica el cumplimiento en sectores como salud, legal o fintech en LATAM y Europa.
Dos acciones concretas que puedes tomar esta semana:
- Audita tus llamadas a la API por tarea. Identifica las que son extracción, resumen corto, clasificación o tool-calling simple — típicamente candidatas a migrar a un modelo local pequeño. Migra esas primero a LFM2.5-350M o 1.2B-Instruct con el QAD Q4_0 GGUF y mide latencia p95 en tu hardware objetivo.
- Prototipa un fallback offline. Sustituye el caso feliz en la nube por el modelo local: si la red falla o el plan enterprise se queda sin cuota, tu producto sigue funcionando. Es un argumento comercial potente para clientes B2B que temen quedarse sin servicio.
El contexto: la cuantización se vuelve estratégica
Liquid AI no está sola en esta carrera. Cohere anunció en mayo de 2026 su Command A+ con Quantization-Aware Distillation como pieza central: cuantizó solo los expertos MoE a 4 bits, mantuvo las rutas de atención críticas en precisión completa y logró una compresión casi lossless que corre en una sola NVIDIA Blackwell B200 o dos H100, según VentureBeat. La técnica deja de ser experimental y se consolida como estándar para entregar modelos grandes en hardware pequeño.
Mientras tanto, la investigación académica también acelera: un equipo de UC San Diego y San Diego State University publicó en enero de 2026 el framework QMC, que combina cuantización outlier-aware con co-diseño de memorias emergentes (ReRAM + MRAM) y reporta reducciones de 6,3×–7,3× en memoria y 12,5× en latencia frente a FP16. Lo que une ambos frentes — Liquid AI con modelos abiertos y UCSD con hardware nuevo — es la misma pregunta: cómo seguir exprimiendo más capacidad por watt en el edge.
Conclusión
Los QAD Q4_0 de LFM2.5 son un paso pequeño en cifras — 4 bits, 230M a 2,6B parámetros — pero conceptualmente enorme: la cuantización ya no obliga a elegir entre tamaño y calidad. Para founders construyendo productos con IA en el dispositivo, el mensaje es claro: la inferencia local dejó de ser una solución de nicho y se está convirtiendo en la opción por defecto para tareas de extracción, agentes ligeros y experiencias offline.
El siguiente movimiento inteligente no es esperar al modelo perfecto, sino empezar a migrar las cargas de trabajo que ya no necesitan la nube.
Fuentes
- LFM2.5 Q4_0 Checkpoints from Quantization-Aware Distillation (fuente original)
- Liquid AI Ships LFM2.5-VL-3B for Faster Vision-Language AI on the Edge — Unite.AI
- Liquid AI’s smallest model yet LFM2.5-230M beats models 4X its size — VentureBeat
- Cohere cracks lossless quantization with Command A+ — VentureBeat
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













