Jev: el modelo de IA que devuelve decisiones, no párrafos
TypeSafe AI, fundada por Diogo Almeida —ex-OpenAI y coinventor del RLHF que está detrás de InstructGPT—, sacó de stealth el 15 de septiembre su primer producto: Jev, un modelo que la compañía presenta como el primer System One Model del mercado. La diferencia no es estética: Jev no genera texto. Recibe un estado y preguntas tipadas, y devuelve decisiones tipadas con probabilidades calibradas que el código puede bifurcar directamente. El nombre es un guiño a la Paradoja de Jevons: cuando una tecnología se abarata, su consumo total sube.
En solo una semana, Jev acumuló cerca de 40 millones de vistas en su vídeo de lanzamiento, eclipsando a GPT-4o (~22M) y a Fable 5 (~15M), según Latent Space. La Discord de TypeSafe pasó de una escala menor a 100.000 personas, y el feed del CEO se mantuvo trending durante varios días.
Qué hace Jev exactamente (y qué no)
La API expone un único endpoint (POST /v1/systemone) y tres primitivas que pueden combinarse en una sola llamada, ejecutándose en paralelo:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Choice: elegir una opción de hasta 255 alternativas (por encima usa un score-then-choose en dos pasadas).
- Score: puntuar contra niveles ordenados.
- Noul: responder con una probabilidad entre 0 y 1 si un enunciado es verdadero.
Cada respuesta trae probabilidades por opción y un valor de confianza entre 0 y 1 derivado de la forma de la distribución. En el ejemplo de la documentación, billing gana con 0.84, pero la confianza agregada queda en 0.596 porque technical aún sostiene 0.159. Esa confianza no es cosmética: la propia docs sugiere tres rutas — actuar si es alta, revisar si es media, mandar a humano si es baja — y umbrales que escalen con el coste de equivocarse.
Según MarkTechPost, los prompts en la API pueden contener varias preguntas a la vez contra el mismo estado, sin que el tiempo de respuesta apenas cambie. El SDK oficial es typesafe-sdk en Python (3.10+) y @typesafe-ai/sdk en JavaScript, y existe un skill listo para Claude Code.
Lo que Jev no hace también importa: no escribe texto libre, no redacta documentos, no mantiene conversaciones. Solo puede devolver lo que cabe dentro del esquema que el desarrollador define. TypeSafe lo resume como una function call con inteligencia de frontera por detrás: estado desordenado entra, decisiones tipadas salen.
Por qué TypeSafe dice que RLHF y RLVR van por mal camino
El punto central del lanzamiento no es técnico, es filosófico. Almeida —que co-firmó el paper de InstructGPT (Ouyang et al., 2022)— argumenta que toda la innovación posterior en la frontera (function calling, structured outputs, reasoning) ha sido un parche sobre la predicción secuencia-a-secuencia, y que esa base produce tres males:
- Alucinaciones: el modelo inventa formatos y categorías fuera del esquema.
- Sicofancia: el modelo se ajusta a lo que el humano quiere oír, no a su probabilidad interna.
- Mode collapse (o mode dropping): el modelo colapsa hacia las salidas más comunes, perdiendo las minorías — exactamente como los GANs frente a los modelos autorregresivos, según Almeida.
La alternativa de TypeSafe se llama RLCD — Reinforcement Learning for Calibrated Decisions, una técnica no publicada que optimiza para «respuestas con probabilidades epistémicamente honestas en tareas de System One». La diferencia con RLVR (rubrics verificables, el método detrás de los modelos de razonamiento actuales) es que, según Almeida, RLVR resuelve problemas como Navier-Stokes pero exacerba la inteligencia irregular y se integra mal con el resto del software. RLCD busca que el modelo sepa cuándo no sabe.
TypeSafe además ha rechazado públicamente el benchmarking público. En el pod con Latent Space, Almeida explicó que los benchmarks abiertos se «hackean» por entrenamiento, y que prefiere medir inteligencia por dólar sobre datos privados.
Pricing y velocidad: los números que importan
Los benchmarks son de TypeSafe, y la propia compañía los matiza, pero los números son los que están moviendo el debate:
- Precio de entrada: US$0,042 por millón de tokens (US$42 por mil millones). Output gratis. TypeSafe sitúa los LLMs de frontera entre US$0,20 y US$10 por millón de tokens de entrada y aproximadamente cinco veces más para output.
- Latencia: 70–500 ms end-to-end (medido desde la costa oeste de EE. UU.), frente a 3–329 segundos para modelos de frontera.
- Demo registrada: Jev terminó una tarea en 0,114 s por US$0,000081; GPT-5.6 Terra tardó 8,566 s y costó US$0,013880.
- Afirmación interna: 193,6× más rápido y 444,6× más barato en workflow evals propios.
Every, en pruebas independientes, reportó en una tarea de extracción que Jev fue ~25× más rápido y ~580× más barato que Claude Fable 5.1 (0,35 s frente a 8,83 s por pasaje). En accuracy interna, TypeSafe reporta ~67,8% en su benchmark de cuatro workflows, comparable a GPT-5.6 Terra, aunque la respuesta de referencia es el promedio entre GPT-6 Astra y Fable 5.1 — no verdad independiente. TypeSafe también aclara que no puede demostrar que su pricing no esté subsidiado.
El «cero alucinaciones» merece asterisco: lo que Jev garantiza es que no devolverá nada fuera del esquema. Una respuesta bien tipada pero incorrecta sigue siendo incorrecta, como recordó KDnuggets.
Quién está construyendo ya con Jev
En menos de una semana desde el lanzamiento aparecieron proyectos públicos:
- Command safety: el CEO de Vercel, Guillermo Rauch, reportó que Jev fue hasta 18× más rápido en p95 que GPT Luna y más preciso; el fx reviewer aún corre sobre Luna.
- Triage de email: Bryo AI (CTO Nikhil Mudholkar) encontró a Gemini ligeramente más preciso, pero 10–20× más caro.
- Browser agents: Browser Use publicó jev-ultrafast, que completó una búsqueda de vuelos de Zúrich a Londres en 7,1 segundos.
- Phone agents: Droidrun lanzó mobile-jev, que manejó Uber en un Android real con 9 acciones en ~21 segundos (sin completar reserva).
- Video scoring: jevmeter puntúa cada frase de un debate por ~US$0,05.
- Live typing: Typewriter de Steve Krouse actualiza 16 juicios mientras escribes.
- Juegos: Jev completó la primera misión de combate de StarCraft y mueve los guardias de heist-one.
- Guardrails de agentes: jev-guard clasifica cada tool call como deny / ask / allow.
- Datos y hogares: pg-jev añade filtros en lenguaje natural a Postgres; HA-Jev convierte respuestas en entidades de Home Assistant.
Por qué un ex-OpenAI apostó contra el scaling
Almeida sostiene la «bitterest lesson»: lo que optimizas define lo que obtienes, y elegir la métrica equivocada —upvotes de preferencia humana en vez de integración con tool calls— arruina el modelo. Por eso TypeSafe se define como un data lab, no un model lab. Su tesis es que una tarea bien definida con buenos datos puede importar más que multiplicar cómputo. Latent Space recoge que Almeida dijo literalmente que no pre-entrenaría con US$1.000 millones.
La ronda respalda el enfoque: según Forkast.news, TypeSafe salió de stealth con una semilla de US$40M liderada por DCVC y una valoración reportada de ~US$200M.
¿Qué significa esto para tu startup?
Si tu producto depende de clasificación, routing, scoring, extracción o detección de intención — tareas que hoy pagan un LLM de frontera para hacer de clasificador caro y lento — Jev entra en el radar como un reemplazo especializado, no como un modelo generalista. Tres movimientos prácticos que puedes hacer esta semana:
- Mapea qué llamadas a tu LLM son realmente «decisiones tipadas». Saca el log de un día y marca cuáles encajan en Choice / Score / Noul: tickets de soporte, moderación, routing de agentes, scoring de anuncios, validación de tool calls. Esas son candidatas directas.
- Monta un A/B con umbral de confianza. La API es lo bastante barata para probar en producción. Define un umbral (por ejemplo, actuar si confianza > 0,85, revisar entre 0,6–0,85, humano si < 0,6) y mide latencia, coste por decisión y tasa de error contra tu stack actual.
- Separa el cognition core del resto del agente. El propio Almeida lo recomienda: descomponer workflows en decisiones pequeñas y medibles, y dejar la generación abierta para System Two (Claude, GPT, Gemini) cuando realmente haga falta. Es el patrón modular que Forkast.describe como el futuro probable del stack agéntico.
Caveat honesto: los benchmarks son de la vendor, los datos independientes son todavía escasos, y el pricing podría no sostenerse. No hay pesos publicados, ni opción de self-host, ni clientes de producción nombrados. Pero si tu unit economics depende de pagar un LLM caro para algo que un clasificador rápido puede hacer, vale la pena una semana de pruebas.
Fuentes
- Latent Space — Jev: System One models for Prod, not God
- MarkTechPost — TypeSafe AI Releases Jev
- How2Shout — Ex-OpenAI Researcher Built an AI Model That Can’t Write a Sentence
- KDnuggets — What Everyone Is Getting Wrong About TypeSafe AI’s Jev
- Forkast — TypeSafe AI’s Jev Is Not an LLM — And That May Be the Point
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













