Por qué los "modelos de decisión" importan (más que los LLMs) para tu agente
Cuando un agente necesita decidir entre tres opciones, no necesita a Claude. Necesita algo más barato, más rápido y que devuelva la respuesta en milisegundos, no en segundos. Esa es la promesa de los modelos de decisión — y la categoría que Typesafe AI encendió el 15 de septiembre de 2026 con su modelo Jev, cuya salida de stealth vino acompañada de una ronda seed inicial, según cubrió The Register en su pódcast The Kettle.
Días después, OpenAI presentó en su DevDay 2026 la Decisions API sobre GPT-6 Luna, pensada para clasificación, enrutamiento y selección de acciones de agentes. Ahora Cloudflare entra al ring con Clef y Clef-flash, dos modelos de decisión open source anunciados el 1 de octubre desde su blog corporativo.
Para un founder la pregunta no es académica: si tu agente gasta segundos enteros y centavos de dólar en cada clasificación binaria, el costo por usuario escala mal. Estos modelos prometen cambiar esa ecuación.
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidadQué ofrece Clef y en qué le gana a Jev
Cloudflare libera Clef y Clef-flash bajo Apache 2.0 en Hugging Face, y los ofrece hospedados en Workers AI. Ambos son API-compatibles con Jev, lo que significa que migrar de un proveedor a otro no requiere reescribir el código de orquestación de tu agente.
Las diferencias técnicas concretas que reporta Cloudflare en su blog:
- Visión por computadora incorporada. Clef trae un encoder visual; Jev solo procesa texto.
- Ventana de contexto de 64k tokens, el doble de los 32k de Jev.
- Latencia: Clef-flash corre a una mediana de 38,8 ms, frente a los 524,1 ms de Jev — unas 13 veces más rápido. El Clef estándar corre a 209,3 ms.
- Benchmarks: en la tabla publicada por Cloudflare, Clef gana a Jev en 8 de 10 evaluaciones del Jev Decision Index, incluyendo BFCL (98,47 vs 95,75), BANKING77 (94,20 vs 79,74 macro-F1) y CLINC150+OOS (97,43 vs 89,27). En Home appliances la ventaja es aplastante: 82,95 (Clef) y 97,73 (Clef-flash) frente a 52,27 de Jev.
- Acuerdo con la API de Jev: los tipos de pregunta
noul(sí/no),choice(opciones) yscore(ranking) funcionan idénticamente, con probabilidad calibrada como salida.
En pruebas internas del equipo de Threat Intelligence de Cloudflare, Clef clasificó un dominio en 2,2 segundos de extremo a extremo (fetch, render y clasificación) frente a los 4,7 segundos de su LLM más rápido (gpt-oss-120b), y devolvió más categorías con probabilidades por opción.
La arquitectura: por qué corre tan rápido
La velocidad no viene de "tener más GPUs", sino de cómo se calcula la decisión. El blog de Cloudflare lo explica: Clef usa Qwen como backbone (Qwen3.8-27B para Clef, Qwen3.5-9B para Clef-flash) y ejecuta un prefill-only pass para después puntuar todas las opciones válidas en paralelo, en lugar de generar texto token a token como haría un LLM autorregresivo.
El paso de decisión es no-autoregresivo: no hay texto intermedio que generar, lo que elimina la mayor parte de la latencia de los LLMs convencionales. Para enrutar la atención usa un proceso de dos etapas que permite a cada opción cruzar atención con otras opciones y con el prompt original, preservando la intención semántica mediante un prior léxico.
El entrenamiento combina cross-entropy con label smoothing sobre las salidas válidas con Brier loss para calibrar probabilidades. Y, dato clave: también adopta el RLCD (Reinforcement Learning for Calibrated Decisions) que Typesafe AI popularizó con Jev — Cloudflare lo usa como objetivo secundario para premiar decisiones adyacentes y penalizar distribution shift.
Open source, RL y fine-tuning: lo que cambia para tu equipo
Tres piezas concretas del anuncio que importan si estás construyendo un agente:
- Pesos abiertos en Hugging Face bajo Apache 2.0. Puedes correr Clef on-prem, auditarlo, ajustarlo y hostearlo donde quieras. No estás atado a Cloudflare como proveedor.
- Servicio de fine-tuning con RL, primero vía un equipo de Forward Deployed Engineers (FDE) de Cloudflare, y más adelante como plataforma self-serve para entrenar y redesplegar tu propio modelo en Workers AI. Casos de uso internos de Cloudflare: clasificar submissions de Trust & Safety, triaje de tickets de soporte y decidir si un bot crawler es benigno o malicioso en sus productos de Bot Management.
- Stack completo sobre infraestructura de Cloudflare: AI Gateway captura tráfico para crear datasets, Workers AI genera rollouts contra el modelo base, Cloudflare Containers funciona como sandbox de RL, un nuevo componente Trainer actualiza los pesos y el modelo afinado se redespliega en Workers AI (incluyendo Bring Your Own Model desde la adquisición de Replicate).
La promesa para un founder: si tu caso de uso tiene años de datos etiquetados, puedes obtener un clasificador más preciso y rápido que el modelo genérico — a cambio de ceder algo de generalidad.
¿Qué significa esto para tu startup?
Si hoy usas un LLM para enrutar tickets, clasificar correos, decidir si un contenido es spam o si un agente debe ejecutar una acción, estás pagando un LLM de propósito general por hacer trabajo de propósito específico. Que Cloudflare se sume a Jev y a la Decisions API de OpenAI — y que plataformas como Vercel, LangChain y GPTBots.ai ya hayan integrado Jev en la primera semana, según reportó Business Insider — confirma que la categoría "modelo de decisión" llegó para quedarse.
Tres acciones que puedes tomar esta semana:
- Audita tu pipeline de agente y separa "clasificar" de "razonar". Si tienes un paso que solo necesita elegir entre 2 y 5 opciones, prueba un modelo de decisión y compara latencia y costo. La API de Jev y la de Clef son intercambiables, lo que reduce el costo del experimento.
- Mide cuánto te cuesta cada decisión hoy. Si una clasificación que haces 1.000 veces por minuto con un LLM te cuesta centavos, multiplica por el volumen mensual. La calculadora se vuelve incómoda rápido — y un modelo de decisión con latencia sub-50 ms cambia el ROI de automatizar casos de uso que hoy descartas por costo.
- Evalúa la opción open source antes que la API hospedada. Clef en Hugging Face con Apache 2.0 te permite correrlo en tu propio hardware si manejas datos sensibles y migrar a Workers AI después. Eso es clave si trabajas en sectores regulados (salud, finanzas) donde el contrato con el proveedor de inferencia es un cuello de botella de procurement.
La capa de "decisión rápida y barata" dentro de una arquitectura de agentes está dejando de ser experimental. La pregunta para el resto de 2026 no es si vas a usar un modelo de decisión, sino cuál y en qué paso del pipeline.
Conclusión
Cloudflare no inventó los modelos de decisión — Typesafe AI lo hizo con Jev hace pocas semanas, y OpenAI lanzó su propia versión en su DevDay 2026. Lo que Clef aporta es una alternativa open source, más rápida en los benchmarks publicados por Cloudflare, con visión por computadora y un servicio de fine-tuning por RL integrado en el resto del stack de Cloudflare. Para los founders, la señal es clara: el costo por decisión en tus agentes está a punto de caer varios órdenes de magnitud. La pregunta es cuánto de tu pipeline de IA puedes convertir para aprovecharlo.
Fuentes
- Introducing Clef: our open-source decision models, and new RL fine-tuning platform (fuente original)
- Jev is rapidly rising to challenge the LLM for enterprise AI supremacy - The Register
- GPTBots.ai Integrates Jev — Two Layers of AI, One Enterprise Platform - Business Insider Markets
- Cloudflare launches Cloudflare OS: an open-source AI agentic workspace for the enterprise - SiliconANGLE
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidad














