Liquid AI LFM2.5-2.6B: 220 tok/s en tu laptop sin cloud

220 tokens por segundo en tu laptop: así funciona el nuevo modelo de Liquid AI

Liquid AI acaba de lanzar LFM2.5-2.6B, un modelo de lenguaje de solo 2.6 mil millones de parámetros que ejecuta agentes de IA completamente en tu dispositivo a 220 tokens por segundo en un Apple M5 Max, usando menos de 2.5 GB de memoria. Para founders que construyen productos con IA, esto significa poder desplegar agentes capaces en laptops, teléfonos y hardware edge sin depender de APIs costosas ni exponer datos de usuarios a la nube.

La compañía, conocida por su arquitectura LFM (Liquid Foundation Model) optimizada para edge, posiciona este lanzamiento como la concretización de su visión: "IA que corre en cualquier lugar". Los pesos del modelo están disponibles públicamente en Hugging Face desde el 4 de agosto de 2026.

¿Por qué un modelo de 2.6B parámetros compite con otros de 10B?

Lo que hace excepcional a LFM2.5-2.6B no es solo su tamaño reducido, sino su rendimiento en tareas agénticas. En benchmarks de uso de herramientas, seguimiento de instrucciones y flujos multi-paso, este modelo compite directamente con arquitecturas 4 veces más grandes como Gemma-4-8B y Qwen3.5-9B.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

El secreto está en el proceso de post-entrenamiento en cuatro etapas:

  1. Fine-tuning supervisado (SFT): dos rondas enfocadas en datos agénticos como uso de herramientas, búsqueda web y trayectorias de harnesses
  2. Especialización por docentes: un modelo teacher especializado por dominio (matemáticas, código, uso de herramientas)
  3. Destilación multi-dominio (MOPD): condensar todos los teachers en un único estudiante
  4. Reinforcement Learning agéntico: entrenamiento RL multi-turno dentro de harnesses reales donde el modelo aprende a coordinar diferentes herramientas y entornos

Esta metodología permite que un modelo pequeño desarrolle capacidades que normalmente requerirían arquitecturas mucho más pesadas, algo crítico para startups que necesitan escalar sin multiplicar costos de inferencia.

Benchmarks: los números que importan para tu producto

Los resultados publicados muestran ventajas concretas en categorías relevantes para aplicaciones reales:

Benchmark LFM2.5-2.6B Gemma-4-8B Qwen3.5-9B
IFBench (seguimiento de instrucciones) 59.17 39.24 56.47
ToolSandbox (uso de herramientas) 77.83 65.00 76.44
Multi-IF (instrucciones múltiples) 80.07 77.35 62.55
LiveCodeBenchv6 (código) 59.41 63.77 69.86
AIME25 (matemáticas) 51.87 34.27 56.07

El modelo lidera en todos los benchmarks de seguimiento de instrucciones y en casi todos los de uso de herramientas, quedando solo por detrás de Qwen3.5-9B en BFCLv4. En tareas agénticas complejas, supera a ambos modelos Gemma y se mantiene competitivo con Qwen.

La única categoría donde los modelos más grandes mantienen ventaja clara es codificación, lo que sugiere que para productos centrados en generación de código complejo, aún conviene optar por arquitecturas de 9B+ parámetros.

Inferencia en CPU y GPU: costos reales de despliegue

La eficiencia de inferencia es donde este modelo cambia la ecuación económica para startups:

En CPU:

  • 220 tokens/s en Apple M5 Max
  • 113 tokens/s en AMD Ryzen AI Max+ 395
  • 30 tokens/s en hardware móvil (suficiente para agentes en teléfonos)

En GPU:

  • Casi 15,000 tokens/s de salida con alta concurrencia en H100
  • Aproximadamente 1.3 mil millones de tokens por día en una sola GPU H100

Para poner esto en perspectiva: una startup que procesa 100,000 solicitudes diarias de agentes podría hacerlo con una fracción del costo de usar APIs cloud, manteniendo los datos en sus propios servidores o incluso en los dispositivos de los usuarios finales.

El modelo tiene soporte nativo desde el primer día en llama.cpp, MLX, vLLM, SGLang y ONNX, lo que elimina fricción técnica para integración en stacks existentes.

Casos de uso donde LFM2.5-2.6B tiene ventaja competitiva

Aplicaciones con privacidad crítica: productos de salud, fintech o legal donde los datos no pueden salir del dispositivo del usuario. El modelo permite agentes completos que operan 100% localmente.

Alto volumen con márgenes ajustados: SaaS B2B que procesan miles de interacciones diarias. Mover la inferencia on-device o a infraestructura propia reduce el costo por solicitud de ~$0.002 (APIs cloud) a ~$0.0002 (infra propia).

Experiencias offline-first: aplicaciones para mercados emergentes o casos de uso con conectividad intermitente. Los agentes funcionan sin conexión a internet una vez descargado el modelo.

Prototipado rápido de agentes: el tamaño reducido permite iterar rápidamente en desarrollo sin esperar colas de inferencia o gestionar costos exponenciales durante testing.

¿Qué significa esto para tu startup?

Si estás construyendo un producto con IA en 2026, LFM2.5-2.6B representa una opción estratégica en tres escenarios:

1. Validación de product-market fit con control de costos

Durante la fase de validación, cada dólar cuenta. Usar un modelo on-device te permite:

  • Probar flujos agénticos completos sin comprometerte con costos de API que escalan linealmente con usuarios
  • Iterar en la experiencia de usuario sin latencia de red
  • Recoger feedback real sin exponer datos de early adopters a terceros

Acción concreta: Descarga el modelo de Hugging Face y monta un prototype local en 48 horas. Usa el código de ejemplo del blog oficial para integrar un agente de investigación que resuma queries de usuarios. Mide la calidad de respuestas versus tu solución actual con API cloud.

2. Diferenciación por privacidad en mercados regulados

Si tu ICP está en salud, fintech, legal o enterprise europeo (GDPR), la capacidad de procesar todo on-device es un argumento de venta poderoso:

  • Eliminas riesgos de compliance relacionados con transferencia de datos
  • Reduces superficie de ataque (no hay datos en tránsito ni en servidores terceros)
  • Puedes certificar que los datos nunca salen del entorno del cliente

Acción concreta: Identifica si tu segmento de mercado tiene requisitos de soberanía de datos. Si es así, construye un demo que muestre el agente funcionando completamente offline. Esto puede ser el factor decisivo en ventas enterprise donde la seguridad es criterio de eliminación.

3. Escalamiento con márgenes sostenibles

El modelo más común de SaaS con IA colapsa cuando los costos de inferencia superan el LTV del cliente. Con LFM2.5-2.6B:

  • Puedes ofrecer planes gratuitos más generosos (el costo marginal es casi cero)
  • Escalar a miles de usuarios sin renegociar contratos con proveedores de API
  • Mantener márgenes del 70-80% incluso en segmentos SMB

Acción concreta: Haz el cálculo unitario. Compara tu costo actual por solicitud usando APIs (OpenAI, Anthropic, etc.) versus el costo de operar LFM2.5-2.6B en tu infraestructura. Si procesas más de 10,000 solicitudes diarias, el ROI de migrar puede ser de meses, no años.

Limitaciones a considerar antes de adoptar

No todo es ventaja. El modelo tiene trade-offs:

  • Codificación compleja: si tu producto genera código production-ready, los modelos de 9B+ siguen siendo superiores en LiveCodeBench
  • Contexto muy largo: aunque soporta 128K tokens, el rendimiento puede degradarse en ventanas extremas comparado con modelos especializados en contexto largo
  • Ecosistema de herramientas: el Agentic RL está entrenado en harnesses específicos (OpenClaw, Hermes Agent). Si usas frameworks personalizados, necesitarás validación adicional

La recomendación: usa LFM2.5-2.6B como tu modelo default para tareas agénticas generales, y haz fallback a modelos más grandes solo para casos específicos que requieran sus capacidades superiores.

Cómo empezar hoy mismo

El modelo está disponible en dos variantes en Hugging Face:

  • LFM2.5-2.6B-Base: modelo base para fine-tuning personalizado
  • LFM2.5-2.6B: modelo listo para inferencia con post-entrenamiento agéntico

Requisitos técnicos mínimos:

  • transformers>=5.0.0
  • 2.5 GB de RAM disponible
  • Soporte para bfloat16 (la mayoría de hardware moderno)

El equipo de Liquid AI también publicó una demo en WebGPU que corre directamente en el navegador, útil para validar casos de uso sin setup local.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...