NeoMME: H Company lanza encoder multimodal 51 páginas/seg

H Company presenta NeoMME: un encoder multimodal entrenado desde cero

H Company, la startup parisienne fundada por exempleados de DeepMind que levantó una ronda semilla de US$220M reportada por Yahoo Finance, liberó el 3 de septiembre de 2026 a NeoMME, una familia de encoders multimodales y multilingües de 260M y 800M parámetros, publicada bajo licencia Apache 2.0. El anuncio llega en el blog de Hugging Face y trae implementación day-zero en transformers.

A diferencia de la mayoría de los retrievers visuales actuales —pensados como adaptaciones de modelos generativos tipo vision-language model—, NeoMME no usa una torre de visión preentrenada ni un modelo de lenguaje causal. Un único Transformer bidireccional procesa tokens de texto y parches de imagen de 32×32 por la misma ruta de cómputo, lo que elimina el overhead de parámetros típico de los VLM.

Sus autores describen el proyecto como un side quest entre dos colegas, entrenado con tiempo y cómputo limitados gracias al respaldo de H Company. El paper técnico, firmado por Aurélien Lac y Tony Wu, fue subido a arXiv el 31 de agosto de 2026 bajo la categoría cs.IR.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Qué cambia frente a ColPali y los VLM actuales

El patrón dominante en retrieval de documentos visuales —seguido por ColPali, ColQwen2.5 y ColSmol—500M— apila un encoder visual preentrenado (como SigLIP2) más un proyector y un decoder causal. Para retrieval, clasificación y token labeling ese decoder es peso muerto: estas tareas no generan texto.

NeoMME entra directamente a ese hueco arquitectónico. Está entrenado desde cero como denoiser de difusión discreta enmascarada: para cada ejemplo textual se muestrea una tasa de corrupción uniforme entre 0 y 1; para los multimodales, entre 0,3 y 1, manteniendo los parches visibles mientras reconstruye texto enmascarado. Con masking agresivo, el modelo se ve forzado a aprender descripciones ancladas a la imagen en lugar de atajos puramente lingüísticos.

El entrenamiento mezcla texto multilingüe, código, matemáticas, imágenes naturales y páginas de documentos: 524B tokens empaquetados en total, de los cuales 290B provienen de ejemplos solo texto. Como esa cifra es chica comparada con los 2T de tokens de ModernBERT, el equipo eligió el optimizador NorMuon para exprimir eficiencia de datos.

Otras decisiones de diseño que importan a quien fine-tunea:

  • Contexto de 16.384 tokens, suficiente para dos imágenes 4K UHD lado a lado.
  • Atención sliding-window simétrica en la mayoría de capas; global cada 6 capas y en la final.
  • Tokenizer BPE entrenado desde cero con 131.072 vocabulario sobre texto multilingüe, código, matemáticas y transcripciones de imágenes producidas por máquina.

Resultados en ViDoRe v3: el Pareto frontier por tamaño

Para evaluar el backbone downstream, H Company hizo fine-tuning con la metodología page-image de ColPali: en vez de recuperar texto extraído de PDFs, NeoMME-Retriever rankea páginas completas como imágenes, saltándose el OCR y preservando tablas, gráficos, tipografía y layout.

Encima del backbone añade dos cabezas entrenadas en conjunto: una densa (mean pooling normalizado) y otra de late-interaction que proyecta cada token o parche a un vector normalizado de 128 dimensiones. Un único forward pass devuelve ambas representaciones.

Los números, según el reporte de H Company y la cobertura de Unite.AI:

  • NeoMME-Retriever-260M alcanza 0,523 nDCG@10 en ViDoRe v3 — la mejor marca entre los modelos evaluados por debajo de 800M parámetros, y a 0,002 de ColQwen2.5 usando 14× menos parámetros.
  • NeoMME-Retriever-800M llega a 0,556 nDCG@10, a 0,009 del Vultron Retriever Flash (0,8B) de tamaño similar.
  • Ambos modelos caen sobre la frontera de Pareto tamaño–calidad de ViDoRe v3.
  • En BEIR-15 (texto puro), el modelo 260M logra 0,4881 y el 800M 0,5126 de nDCG@10 con late interaction, según el model card.

Los autores remarcan que los puntajes de competidores vienen de MTEB y los suyos son evaluaciones propias — una aclaración importante si vas a citarlos en un paper o board deck.

Velocidad y compresión: las dos cifras que importan al founder

Dos métricas hacen a NeoMME especialmente atractivo para producto, no solo para investigación:

1. Throughput de indexado. En una NVIDIA L40S, a tamaño de entrada matched de 2048×2048, el modelo 260M codifica ~51 páginas/segundo, casi el doble que ColModernVBERT (~26 páginas/seg). Indexar un corpus grande deja de ser el cuello de botella que era.

2. Compresión de embeddings late-interaction. El almacenamiento escala lineal con la cantidad de vectores: una página 2048×2048 produce ~4.200 vectores — unos 2,1 MB en float32, con un promedio medido de ~1,5 MB por documento en ViDoRe v3. Para un corpus empresarial eso multiplica rápido.

H Company combinó dos técnicas —hierarchical token pooling (reemplazar clusters de vectores similares por su media) más quantization asimétrica (documentos a int8 o binario, queries a precisión alta on-the-fly)— y reportó dos configuraciones útiles en producción:

  • Pooling factor 10 + int8 en ambos lados → 39 kB por página (39× menos) reteniendo >99 % del nDCG@10 baseline.
  • Pooling factor 8 + queries int8 + documentos binarios → 6 kB por página (255× menos) reteniendo >95 % del nDCG@10.

Esa compresión no es accesoria: cambia la economía de montar retrieval visual sobre millones de páginas en un vector store como Qdrant, Weaviate o Milvus.

¿Qué significa esto para tu startup?

NeoMME no reemplaza un LLM. Es un encoder de representación, y ahí está su valor: si tu producto vive de buscar entre PDFs, contratos, facturas, slides, capturas de dashboards o reportes escaneados, esta es la capa que faltaba. Tres formas de usarlo hoy:

  • Sustituye tu pipeline de OCR + embeddings de texto. Si hoy haces PDF → OCR → chunk → embed y perdiste tablas y layout, prueba NeoMME directo sobre la imagen de la página. La diferencia se nota en documentos con tipografía pequeña, gráficos mezclados con prosa o páginas en varios idiomas.
  • Usa Apache 2.0 sin pagar licencias. A diferencia de modelos que exigen acuerdos comerciales, todo el repositorio de NeoMME —backbone + checkpoints de dense y late-interaction— sale bajo Apache 2.0. Para una startup eso elimina el gate legal y acelera el go-to-market.
  • Empieza con dense retrieval, termina con late-interaction rerank. Para corpus grandes (millones de páginas), indexa con embeddings densos en un ANN, recupera el top-k y rerankea con late-interaction. El paper recomienda esa cascada porque el forward pass devuelve ambas salidas sin costo extra. La librería NextPlaid, mencionada por los autores, facilita ese flujo open source.

Próximo paso concreto: corre la demo visual RAG en Hugging Face Spaces (tonywu71/neomme-retriever-demo) sobre tu propio PDF antes de invertir semanas en integrarlo. Si una página de tu corpus arroja buenos resultados en la demo, vale la pena el fine-tuning con Sentence Transformers v6 (los checkpoints separados ya están publicados).

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...