CLM-8B de Stanford y Nvidia: 9x más rápido que Jev

El nuevo modelo contrastivo de Stanford y Nvidia

Un equipo de Stanford y Nvidia liberó esta semana CLM-8B, el primer modelo open source de una nueva categoría que denominan Contrastive Language Models (CLMs). La diferencia central es estructural: en lugar de generar texto token a token, CLM codifica el estado actual del agente y las acciones disponibles como embeddings separados y devuelve la acción con mayor similitud. El resultado publicado en pruebas zero-shot es una inferencia hasta 9 veces más rápida que Jev, el modelo System One lanzado por TypeSafe AI el 15 de septiembre de 2026.

La cabeza entrenable pesa apenas 75 MB y se distribuye bajo licencia Apache 2.0. El cuello del modelo es un Qwen3-8B congelado y dos cabezas de proyección (estado y acción) que se entrenan por separado, según detallaron los investigadores en el blog técnico de Contrastive-LM y replicó Marktechpost.

Para un founder, esto importa porque cada decisión de routing, triage o verificación dentro de un agente multi-paso deja de ser una llamada a un LLM generativo. Cuando un agente hace docenas de estas llamadas por consulta, el ahorro acumulado se vuelve significativo.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Cómo CLM replantea las decisiones de los agentes

El entrenamiento se hizo en tres etapas con datos verificables en el release:

  • Pre-entrenamiento sobre unos 60 millones de pares pregunta-respuesta de Nemotron DQA para enseñar coincidencia semántica amplia.
  • Mid-training con unos 30 millones de negativos difíciles sintéticos generados por Gemini 2.5 Flash-Lite (preguntas de opción múltiple con respuestas similares y solo una correcta).
  • Post-training sobre aproximadamente 1 millón de trayectorias de agente de Agent Data Protocol, Endless-Terminals y LiteCoder-SFT.

La función de pérdida es InfoNCE, que acerca el embedding del estado a la acción correcta y lo aleja de las incorrectas. A diferencia del ajuste fino supervisado estándar con cross-entropy, Jacky Kwok, líder del proyecto en Stanford, señaló a VentureBeat que el objetivo contrastivo «puede ser especialmente efectivo para tareas de toma de decisiones comparado con SFT tradicional» y que partir de un checkpoint preentrenado de CLM permite adaptarse rápido a dominios específicos.

La consecuencia operativa más importante es el caching asimétrico. Como los estados cambian en cada paso pero las acciones suelen ser las mismas, CLM puede precalcular y guardar los embeddings de las acciones una sola vez. Cada nueva consulta solo necesita codificar el estado y compararlo contra el caché. Según el model card, con 1.000 candidatos en caché la latencia cae 13 veces frente a la versión sin caché; en una RTX 4090 con 3 acciones, la latencia por estado revisitado baja de 1,7 ms a 0,6 ms.

Resultados frente a Jev: velocidad vs precisión

Las pruebas zero-shot publicadas enfrentan a CLM-8B con Jev en cuatro tareas. Los números provienen de la tabla divulgada por el equipo de CLM y replicada por Marktechpost:

Tarea Latencia CLM-8B Latencia Jev Éxito CLM Éxito Jev
Juego T-Rex 16,5 ms 149,8 ms 5/5 5/5
Tool calling (BFCL v4) 76,8 ms 125,5 ms 95,2 % 99,2 %
WikiRacing 79,8 ms 225 ms 26/30 30/30
Super Mario 33,5 ms 132,6 ms 5/5 5/5

El 9 veces más rápido sale del T-Rex, donde las acciones se repiten entre estados. CLM empata en éxito en T-Rex y Super Mario; cede precisión en BFCL v4 (95,2 % vs 99,2 %) y WikiRacing (26/30 vs 30/30).

Como verificador para agentes de código, los resultados son más favorables. Los investigadores generaron candidatos con Opus 5 (best-of-4 en DeepSWE) y Fable 5 (best-of-5 en Terminal-Bench 2.1), y dejaron que CLM eligiera:

  • DeepSWE (38 tareas): CLM afinado alcanza 81,6 % pass@1, frente a 71,1 % de Jev. Latencia: 79 ms vs 449 ms (5,7 veces más rápido).
  • Terminal-Bench 2.1 (30 tareas): CLM llega a 87,6 %, frente a 83,1 % de Jev. Latencia: 32 ms vs 131 ms (4,1 veces más rápido).

Estos son resultados sobre subconjuntos held-out, no sobre el leaderboard completo. Y, como aclara VentureBeat, CLM no resuelve las tareas desde cero: un modelo grande crea las soluciones y CLM decide cuál entregar.

Dónde encaja CLM en el stack de IA empresarial

Kwok lo resume así: «usa modelos grandes de razonamiento para generar y razonar, y CLMs para seleccionar, verificar y monitorear sus_outputs de forma barata». Esto se traduce en patrones concretos que ya están en producción o son triviales de implementar:

  • Routing de herramientas: dado un estado del agente y 50 acciones internas (resetear password, provisionar acceso, abrir ticket, escalar a seguridad), CLM codifica las 50 una vez y las reutiliza. Cada nueva solicitud solo codifica el estado.
  • Triage de tickets de soporte: eligen entre emitir reembolso, escalar a humano, pedir más información o cerrar ticket. La probabilidad calibrada permite derivar a humanos cuando la confianza es baja.
  • Ranking best-of-N: el modelo grande genera N candidatos y CLM selecciona el mejor. Aquí es donde CLM supera al propio Jev en los subsets reportados.
  • Capa de monitoreo: Kwok destaca que CLM muestra una «separación clara» entre scores para trayectorias exitosas y fallidas, lo que permite marcar comportamiento inusual en agentes de larga ejecución.

El propio equipo y KDnuggets coinciden en que CLM no reemplaza al LLM razonador: para problemas abiertos, matemática, planificación de alto nivel o generación de respuesta larga sigue siendo mejor un frontier model. Su nicho son las decisiones con conjunto de opciones cerrado y conocido.

Por qué Jev importa en la conversación (y cómo se compara)

CLM no llega en el vacío. El 15 de septiembre, TypeSafe AI presentó Jev como el primer System One Model comercial: un transformer que devuelve decisiones tipadas con probabilidades calibradas, entrenado con un método propio llamado Reinforcement Learning for Calibrated Decisions (RLCD). La API expone tres primitivas (Choice, Score, Noul) y cuesta 0,042 dólares por millón de tokens de entrada, con salida gratis, según la documentación de TypeSafe.

TypeSafe fue fundada en 2024 por Diogo Almeida (ex-OpenAI, participó en RLHF, InstructGPT, ChatGPT y GPT-4), Erik Gafni y Sasha Sheng, y levantó 40 millones de dólares en seed liderados por DCVC, reportó CryptoBriefing. Jev es closed-source, con lista de espera, y ya tiene a Vercel reportando hasta 18 veces más rápido que GPT Luna en clasificación de comandos.

Las diferencias técnicas entre CLM y Jev, según Kwok: CLM puede cachear embeddings de estado y de acción por separado gracias a su doble encoder, mientras que Jev y Laya (otro System One encoder bidireccional pequeño) cachean sobre todo el estado. En aplicaciones con acciones reutilizables definidas de antemano —las herramientas internas de una empresa, por ejemplo— esa diferencia arquitectónica se traduce en menos cómputo por solicitud.

Qué significa esto para tu startup

Si tu producto depende de agentes que llaman LLMs para routing, clasificación o verificación, este lanzamiento cambia el cálculo de costos sin obligarte a salir de tu stack open source.

Acciones concretas que podés implementar esta semana:

  • Auditar las llamadas de bajo valor en tu agente. Identifica los puntos donde tu LLM principal solo está eligiendo entre 2 y 10 opciones fijas (siguiente herramienta, categoría de ticket, acción sobre el DOM). Esos son candidatos naturales a CLM o, si preferís no self-hostear, a Jev.
  • Probar el verificador sobre tu flujo best-of-N. Si ya generas varios candidatos con un modelo grande y los rankeás con el mismo modelo o con reglas, CLM afinado podría mejorar la selección y reducir latencia. El ejemplo de DeepSWE (de 71,1 % a 81,6 % al pasar de Jev a CLM como verificador) sugiere que el verificador adecuado se paga solo en tareas de código.
  • Diseñar el caché desde el día uno. Si tu catálogo de acciones o workflows es estable, precomputar los embeddings de acción te da la mayor parte del beneficio de latencia. El equipo de CLM expone esto vía clm-serve, que reserva una porción de memoria GPU al estilo del KV cache de vLLM.

El techo inmediato para CLM no es de capacidad, sino de integración. El propio equipo entrena un CLM-35B-A3B multimodal con más datos agentic, previsto para principios de octubre, según adelantó Kwok. Mientras tanto, el Apache 2.0 permite clonar el repo y montar la cabeza en una sola GPU hoy: los pesos están en Hugging Face bajo Contrastive-LM/CLM-v0.1-8B.

Conclusión

CLM-8B no reemplaza al LLM razonador, pero sí abre un carril específico y muy demandado: el de las decisiones acotadas dentro de un agente que hoy se pagan al precio de un modelo generativo. La apuesta de fondo es que el cuello de botella de los agentes en producción no es la generación, sino la orquestación barata y determinista entre cientos de micro-decisiones. Stanford y Nvidia acaban de poner un competidor open source a una categoría que TypeSafe había inaugurado sola diez días antes.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...