LFM2.5-VL-3B: modelo visión-lenguaje de LiquidAI corre local en 2026

LFM2.5-VL-3B: el modelo de visión-lenguaje más capaz que puedes ejecutar en tu hardware

LiquidAI acaba de lanzar LFM2.5-VL-3B, un modelo de visión-lenguaje de 3.100 millones de parámetros diseñado específicamente para ejecutarse en dispositivos de borde sin conexión a la nube. Según el anuncio oficial del 12 de agosto de 2026, este es el modelo más capaz de su clase que puedes ejecutar en tu propio hardware, con mejoras significativas en comprensión de pantallas, detección de objetos y llamadas a funciones.

El modelo procesa 228 tokens por segundo en un M5 Max y 116 tokens por segundo en un Ryzen AI Max+ 395, ocupando solo 3 GB de memoria. Incluso alcanza 20 tokens por segundo en un Galaxy S26 Ultra, lo que permite ejecución completamente local en smartphones de gama alta.

¿Qué hace diferente a LFM2.5-VL-3B?

LFM2.5-VL-3B introduce cuatro mejoras principales respecto a versiones anteriores:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Comprensión de pantallas/UI: Entiende interfaces digitales en diferentes dispositivos con puntuaciones de 78.7% en ScreenSpot-v2 Desktop, 81.2% en Mobile y 82.2% en Web
  • Grounding mejorado: Detección de objetos con consultas en lenguaje natural alcanzando 87.9% en RefCOCO-avg
  • Entrada multi-imagen: Razonamiento mejorado entre múltiples imágenes con 61.5% en BLINK y 58.3% en MuirBench
  • Llamadas a funciones: Capacidad significativamente mejorada para llamar a herramientas en situaciones de texto y visión-texto

Rendimiento en benchmarks: compite con modelos más grandes

En las pruebas comparativas, LFM2.5-VL-3B supera a modelos de su clase y compite con alternativas más grandes:

  • Promedio general: 69.4% vs 57.2% de su predecesor LFM2-VL-3B
  • Documentos y OCR: 84.2% en OCRBench v1 y 91.1% en DocVQA
  • Razonamiento STEM: 68.5% en MathVista (mini) y 30.5% en MMMU-Pro
  • Comprensión multilingüe: 83.0% en MMMB y 79.5% en Multilingual MMBench

El modelo también muestra fortaleza en benchmarks de solo texto, con 82.3% en IFEval para seguimiento de instrucciones y 59.5% en ToolSandbox para uso de herramientas, igualando a Gemma-4-E2B y Qwen3.5-2B.

¿Cómo se entrenó este modelo?

LFM2.5-VL-3B combina un codificador visual SigLIP2 400M NaFlex con el mismo backbone pre-entrenado que LFM2.5-2.6B. Fue pre-entrenado en aproximadamente 34 billones de tokens, con 4 veces más datos visuales que versiones anteriores, extraídos de conjuntos curados y sintéticos de imágenes-caption, OCR, grounding y seguimiento de instrucciones.

Para soportar scripts no latinos, el vocabulario se duplicó a 128.000 tokens mediante expansión del tokenizer en lugar de reentrenar desde cero. El post-entrenamiento incluye dos etapas: fine-tuning supervisado con destilación de conocimiento de un modelo maestro más grande y entrenamiento Antidoom, seguido de aprendizaje por refuerzo multi-recompensa.

Velocidad de inferencia: optimizado para producción

LFM2.5-VL-3B incluye soporte de día uno en todo el ecosistema de inferencia: llama.cpp, MLX, vLLM, SGLang y ONNX. En GPU, es el más rápido en entradas multi-frame y alcanza aproximadamente 11.000 tokens por segundo en alta concurrencia, lo que suma casi 1.000 millones de tokens de salida por día en una sola H100.

Según Liquid AI, la empresa ha enviado 52 LFMs con 38.7 millones de descargas y 3.000+ variantes, desplegándose en teléfonos, laptops, autos, espacio, e-commerce, servicios financieros, biología y defensa.

¿Qué significa esto para tu startup?

1. Oportunidad para aplicaciones de visión local sin dependencia de la nube

Si tu startup desarrolla aplicaciones que requieren procesamiento visual en tiempo real —como asistentes de compras con reconocimiento de productos, herramientas de análisis de documentos, o interfaces conversacionales con imágenes— LFM2.5-VL-3B elimina la necesidad de enviar datos a servidores remotos. Esto reduce costos de infraestructura, mejora la privacidad del usuario y permite funcionamiento offline.

Acción concreta: Evalúa migrar componentes de visión de tu aplicación a inferencia local usando este modelo. La reducción de latencia puede mejorar significativamente la experiencia de usuario en casos de uso como escaneo de documentos en tiempo real o reconocimiento de objetos en video.

2. Ventaja competitiva en nichos específicos

La especialización en comprensión de pantallas y documentos posiciona a LFM2.5-VL-3B como herramienta ideal para startups que trabajan en:

  • Automatización de procesos: Extracción de datos de facturas, contratos o formularios
  • Testing de UI/UX: Análisis automático de interfaces de usuario
  • Accesibilidad: Descripción de contenido visual para usuarios con discapacidad visual
  • Educación: Tutoriales interactivos que responden a capturas de pantalla

Acción concreta: Identifica si tu producto actual requiere capacidades de visión que puedan mejorarse con este modelo. Considera desarrollar un MVP que aproveche sus fortalezas específicas para diferenciarte de competidores que usen soluciones genéricas.

3. Reducción de costos operativos

Ejecutar inferencia localmente elimina costos recurrentes de APIs de visión en la nube, que pueden escalar rápidamente con el crecimiento de usuarios. Según datos de Liquid AI, el modelo genera casi 1.000 millones de tokens por día en una sola H100, lo que representa una relación costo-rendimiento significativamente mejor que servicios cloud para volúmenes altos.

Acción concreta: Calcula tu costo actual por inferencia de visión y compáralo con el costo de ejecutar LFM2.5-VL-3B en tu infraestructura. Para aplicaciones con alto volumen de procesamiento visual, el ROI puede justificarse en meses.

Cómo empezar a usar LFM2.5-VL-3B

El modelo está disponible hoy en Hugging Face y puedes:

  1. Descargarlo directamente: LFM2.5-VL-3B en Hugging Face
  2. Probar el demo en el navegador: WebGPU demo sin necesidad de configuración
  3. Fine-tunear para tu caso de uso: Tutoriales disponibles en el repositorio de cookbooks

El código de ejemplo básico requiere transformers>=5.10.1 y permite cargar y ejecutar el modelo en pocas líneas de Python, con soporte para múltiples imágenes, grounding, OCR y llamadas a herramientas.

El futuro de la IA en el edge

LFM2.5-VL-3B representa un paso significativo hacia modelos de visión-lenguaje que pueden ejecutarse eficientemente en dispositivos de consumo. Para founders, esto abre nuevas posibilidades para construir aplicaciones que combinen capacidades visuales avanzadas con los beneficios de la computación local: menor latencia, mayor privacidad y control total sobre la infraestructura.

La tendencia hacia modelos más eficientes que mantienen capacidades de modelos más grandes continuará acelerándose en 2026, creando oportunidades para startups que puedan identificar y ejecutar en casos de uso específicos donde la inferencia local ofrece ventajas competitivas sostenibles.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...