NVIDIA Kumo Tabular: predicción sin entrenamiento

NVIDIA Kumo Tabular: el modelo que predice tablas sin entrenar

NVIDIA lanzó Kumo Tabular, un modelo fundacional open source para datos tabulares ya disponible en Hugging Face. La promesa es directa: recibe una tabla con filas etiquetadas, devuelve predicciones para filas nuevas en una sola pasada, sin entrenar, sin ajustar hiperparámetros y sin feature engineering. Es la primera vez que un modelo de esta familia se posiciona como estado del arte en los cuatro benchmarks públicos que importan en el sector.

Para cualquier founder que lidia con churn, fraude, riesgo crediticio, forecast de demanda o scoring de clientes, esto cambia el cálculo: lo que antes era un proyecto de ciencia de datos de semanas se convierte en una llamada a una API.

Qué hace Kumo Tabular y por qué importa

Kumo Tabular es un Transformer diseñado alrededor de la estructura de una tabla. Combina tres mecanismos descritos en los papers TabICL y TabPFN: atención por columna, atención por fila y aprendizaje en contexto. Para predecir una etiqueta hace tres cosas: entender qué significa cada valor dentro de su columna, cómo interactúan las columnas de una fila, y cómo relacionar filas de contexto etiquetadas con filas de consulta sin etiqueta.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Tres detalles técnicos lo separan de intentos anteriores:

  • Embeddings celulares con Fourier features: valores numéricos y categóricos pasan por senos y cosenos de frecuencias aprendidas, con pesos separados por tipo. Los valores faltantes no requieren imputación, se tratan de forma especial.
  • Atención por columna con costo lineal: aprende si un valor es típico o extremo dentro de su distribución, creciendo linealmente con el número de filas, no cuadrático.
  • Temperatura de atención según longitud: a medida que la tabla crece, la atención softmax se diluye; Kumo escala cada query con una temperatura que crece con el logaritmo del número de keys, manteniendo la atención afilada incluso con decenas de miles de filas.

El modelo fue entrenado únicamente con datos artificiales, generados a partir de Modelos Causales Estructurales (SCM) muestreados proceduralmente. En total, las versiones Small/Medium/Large vieron aproximadamente 35/71/137 millones de tablas sintéticas. Los autores también mencionan que la receta de entrenamiento y los generadores de datos sintéticos se publicarán pronto.

Resultados en benchmarks: lidera en los cuatro

Kumo Tabular se evaluó en los principales rankings públicos de predicción tabular:

  • TabArena: rank #1 overall con ELO 1950, y funciona 17 veces más rápido que LimiX-2 bajo la misma evaluación en una sola RTX 6000 Pro.
  • BeyondArena: rank #1 con ELO 1418 y un Improvability score del 7,78%.
  • TALENT: top overall en accuracy de clasificación (rank promedio 6,67), log-loss de clasificación (3,98) y RMSE de regresión (4,22).
  • ScoringBench: las versiones Large y Medium ocupan el primer y segundo puesto por rank promedio en predicción de distribuciones.

El contexto competitivo importa: TabPFN-3.5 Plus de Prior Labs (ahora parte de SAP, tras una adquisición completada en julio de 2026 en la que SAP se comprometió a invertir más de €1.000 millones) se presenta como el modelo más preciso y escalable según TabArena y BeyondArena, según el comunicado oficial de SAP. Causilo de Nums AI, lanzado el 15 de septiembre de 2026, lidera TabArena entre modelos individuales con ELO 1792,9 y tiene licencia Apache-2.0 para el código (los pesos son solo para investigación). Y H2O.ai presentó tabH2O en Dell Technologies World 2026 como su apuesta empresarial, con foco en soberanía de datos y despliegues on-premises y air-gapped.

En resumen: Kumo Tabular no entra solo a una categoría vacía, compite de frente con SAP/Prior Labs, H2O.ai y Nums AI por un mercado que recién está tomando forma.

Tamaño, licencia y cómo se usa

Kumo Tabular viene en tres tamaños: 28M, 115M y 215M parámetros (Small/Medium/Large), publicados bajo la licencia OpenMDW-1.1, que permite uso comercial. El código del modelo está en GitHub (NVIDIA/structured-data-models) y los pesos en Hugging Face (nvidia/Kumo-Tabular).

El flujo de uso es deliberadamente corto. Se carga la tabla como pandas.DataFrame, se tensoriza, se instancia el modelo y se llama a predict con las filas de contexto (features + labels) y las filas de consulta (solo features):

import sdm  # structured-data-models
table = sdm.TableTensor.from_pandas(pd.load_csv(...), device="cuda")
na_mask = table["target"].isnan()
model = sdm.models.KumoTabular(device="cuda")
pred = model(
    x_context=table[~na_mask].drop_columns("target"),
    y_context=table[~na_mask, "target"],
    x_query=table[na_mask].drop_column("target"),
)

La librería descarga los pesos del Hub en el primer uso y se encarga del preprocesamiento, el ensamble y el manejo de muchas clases.

Limitaciones que conviene conocer antes de adoptarlo

Kumo Tabular no es magia. La documentación oficial de NVIDIA señala tres restricciones operativas:

  • Trabaja solo con columnas numéricas y categóricas. Texto, imágenes y timestamps requieren preprocesamiento con las recetas incluidas en la librería.
  • Una sola pasada cubre hasta 10 clases. Para más clases, la librería recurre a códigos de salida correctores de errores.
  • La accuracy puede degradarse en tablas mucho más grandes que las del entrenamiento o cuando las filas de consulta provienen de una distribución distinta a las de contexto.

El consejo del propio equipo: validar accuracy y calibración con datos held-out propios antes de desplegar en producción.

Qué significa esto para tu startup

Si tu startup depende de predecir algo a partir de tablas (clientes, transacciones, sensores, leads, tickets), este lanzamiento baja la barrera de entrada al estado del arte. Ya no necesitas un pipeline de weeks-long con data scientists para llegar a un baseline decente.

Tres acciones concretas que podés tomar esta semana:

  • Prototipa un caso de uso en una tarde. Levantá un dataset propio en CSV, corré las 30 líneas de código de ejemplo y compará contra tu modelo actual (XGBoost, LightGBM). El benchmark TabArena de NVIDIA sugiere que podés igualar o superar baselines tuned con menos fricción operativa.
  • Evalúa soberanía y costo. Si tus datos son sensibles (salud, finanzas, gobierno), Kumo Tabular corre on-premises vía la librería sdm; alternativas como tabH2O de H2O.ai están preintegradas en Dell AI Factory con NVIDIA y ofrecen despliegues air-gapped. Comparar el costo total (licencia + GPU + integración) contra construir un pipeline clásico sigue siendo un ejercicio que vale la pena.
  • Mide accuracy vs. contexto. Los modelos tabulares fundacionales son sensibles al tamaño y la distribución del contexto. Antes de comprometerte, validá con un split realista de tus datos: el costo de implementación es bajo, pero el de un modelo mal calibrado en producción no lo es.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...