Jev, el nuevo modelo de IA que devuelve decisiones, no texto
TypeSafe AI presentó el 15 de septiembre Jev, un modelo que la propia compañía bautiza como el primer System One model (en honor al Sistema 1 de Daniel Kahneman: pensamiento rápido e intuitivo) y que el desarrollador Simon Willison, autor del análisis, prefiere llamar directamente decision model. La diferencia con un LLM convencional es estructural: en lugar de generar texto token a token, Jev recibe un objeto de estado más preguntas tipadas y devuelve números en coma flotante, probabilidades calibradas y scores de confianza.
El propio TypeSafe lo resume como «un function call de inteligencia frontier: estado no estructurado dentro, decisiones probabilísticas tipadas fuera». Para un founder, esto significa que en lugar de pagar por prosa que después hay que parsear, se obtiene directamente una respuesta estructurada que el código puede bifurcar sin ambigüedad.
Qué hace exactamente Jev y en qué se diferencia de un LLM
El modelo trabaja con tres tipos de preguntas, evaluadas en paralelo sobre el mismo estado:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Choice: elegir una opción dentro de un set de hasta 255 alternativas, con probabilidades y confianza.
- Score: puntuar sobre una escala ordenada que tú defines (por ejemplo, «tranquilo → irritado → muy enfadado»).
- Noul: preguntas sí/no; según confirmó el CEO en Hacker News, el nombre viene de la distribución de Bernoulli y devuelve un número entre 0 y 1.
Como cada llamada acepta tantas preguntas como quepan en la ventana de contexto (en torno a 32.000 tokens de estado y pregunta), el coste marginal de añadir más preguntas es casi nulo. TypeSafe reporta que enviar 13 preguntas en una sola llamada es aproximadamente 11,5 veces más barato y 9,6 veces más rápido que hacerlas de una en una.
El otro cambio importante: Jev no genera texto. Es una restricción deliberada, no una limitación. La compañía argumenta que obligar a un LLM a hacer routing, clasificación y decisiones estructuradas es lo que hincha la latencia y el coste de los pipelines agentic actuales.
Precio y latencia: el argumento económico
Los números que TypeSafe publicó en su lanzamiento son el verdadero gancho del producto:
- Coste de entrada: US$0,042 por millón de tokens de input; los tokens de salida se cobran a cero.
- Latencia end-to-end: entre 70 y 500 ms, frente a los 3 a 329 segundos de modelos frontier comparables.
- En su demo grabado, Jev resolvió una tarea en 0,114 s por US$0,000081, mientras que GPT-5.6 Terra lo hizo en 8,566 s por US$0,013880.
- En benchmarks internos, TypeSafe afirma que Jev es 193,6 veces más rápido y 444,6 veces más barato que modelos frontier en tareas de decisión.
El test independiente más citado lo realizó Every, que comparó Jev con Claude Fable 5.1 en una tarea de extracción: Jev fue ~25 veces más rápido y ~580 veces más barato (0,35 s frente a 8,83 s por pasaje). También el CEO de Vercel, Guillermo Rauch, reportó que el revisor de comandos de su plataforma fue hasta 18 veces más rápido en p95 usando Jev frente a GPT Luna, con mejor precisión.
Hay que leer estos números con cuidado: los benchmarks de TypeSafe miden acuerdo con GPT-6 Astra y Claude Fable 5.1, no contra verdad de terreno independiente, y los flujos los escribió el propio equipo de capacidades de la compañía.
Quién está detrás y por qué importa
El CEO es Diogo Almeida, ex-investigador de OpenAI y coinventor de RLHF, la técnica que dio lugar a InstructGPT y GPT-4. Le acompañan Erik Gafni y Sasha Sheng. TypeSafe salió del stealth el 15 de septiembre con una ronda semilla de US$40 millones liderada por DCVC, según reportó Forkast, con una valoración aproximada de US$200 millones. El nombre del modelo homenajea la Paradoja de Jevons: cuando algo se vuelve más eficiente, el consumo total tiende a subir en vez de bajar.
En menos de una semana la compañía tuvo que retirar la lista de espera; el 20 de septiembre abrió el acceso público, regalando US$5 en créditos a nuevos usuarios. A esa velocidad se sumaron integraciones con LiteLLM, Netlify AI Gateway, Cloudflare, OpenRouter y Vercel.
El elefante en la sala: la caja negra y el sesgo
Willison señala un punto incómodo que cualquier founder debe tener en mente: Jev es aún más opaco que un LLM convencional. Un LLM, al menos, puede dar una explicación en lenguaje natural (aunque no sea garantía de que sea correcta). Jev solo devuelve un número. Si marca un correo como spam, no hay forma directa de saber qué señales lo inclinaron hacia esa decisión.
Esto vuelve crítico el riesgo de sesgo. Willison lo dice sin rodeos: «Espero que nadie use Jev para rankear candidatos a un puesto; ese número en coma flotante puede ocultar todo tipo de sesgos baked into en el modelo, y desmontarlos experimentalmente va a ser complicado». En su propia prueba, Jev calificó a las ciudades del Área de la Bahía según la pregunta «¿Es una buena ciudad?» y puso Cupertino arriba y East Palo Alto abajo, una decisión difícil de defender con datos objetivos.
La buena noticia: como cada llamada cuesta fracciones de céntimo, es viable correr cientos o miles de prompts experimentales para auditar el modelo antes de ponerlo en producción. La docs oficial recomienda tres rutas por banda de confianza: actuar cuando la confianza es alta, revisar en el rango medio y mandar a humano cuando es baja.
Qué significa esto para tu startup
Si estás construyendo agentes, un pipeline de soporte o cualquier flujo donde hoy usas un LLM caro y lento para tareas de clasificación, Jev propone extraer esas decisiones a un primitivo dedicado y reservar el modelo generativo solo para las partes que realmente requieren razonamiento abierto. La métrica que importa no es la novedad, sino el coste por decisión y la latencia: en tareas donde la respuesta es estructurada por definición, gastar 0,1 s y US$0,00008 cambia la economía unitaria del producto.
Tres acciones concretas que puedes tomar esta semana:
- Inventariar tus llamadas a LLM y separar cuáles son de generación (copy, código, razonamiento abierto) de cuáles son de decisión (routing de tickets, scoring de candidatos, clasificación de intents). Las del segundo grupo son candidatas directas a migrar a Jev o a un competidor equivalente.
- Medir latencia y coste por decisión, no por llamada. Un agente que hoy encadena cinco prompts para clasificar un ticket puede reducirse a una sola llamada con cinco preguntas en paralelo, con el ahorro de coste y tiempo que eso implica.
- Diseñar umbrales de confianza antes de poner el modelo en producción. Define qué pasa cuando la confianza es alta, media y baja. El propio TypeSafe sugiere umbrales más altos para acciones irreversibles (transferencias, borrados) y más bajos para acciones de bajo riesgo (mostrar un saldo).
Si quieres profundizar, la mejor lectura de partida es el análisis de Simon Willison, el perfil de la compañía y la apuesta arquitectónica en Forkast y la guía técnica con ejemplos de código y patrones de diseño en MarkTechPost.
Fuentes
- Jev introduces a new shape of LLM — System One, aka Decision Models
- TypeSafe AI’s Jev Is Not an LLM — And That May Be the Point (Forkast)
- TypeSafe AI Releases Jev: A System One Model That Returns Typed, Calibrated Decisions (MarkTechPost)
- TypeSafe opens Jev AI to public after rapid adoption forces waitlist removal (CryptoBriefing)
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













