El agente que decide (pero no habla)
Jev, el primer modelo "System One" de TypeSafe AI, no genera texto: devuelve decisiones tipadas con distribución de probabilidad. Diseñado por ex investigadores de OpenAI, Google Brain y Meta/FAIR, está pensado para que un programa consuma su salida directamente en un if, sin parsear prosa.
Un equipo de Tenuo acaba de publicar un caso práctico que muestra cómo encaja Jev en un agente real: safe-upgrade, un agente open-source para actualizar dependencias construido sobre Jev, LangGraph y Tenuo, disponible como npx @tenuo/safe-upgrade doctor y npx @tenuo/safe-upgrade assess --repository ..
Qué hace Jev (y qué no hace)
La API expone tres primitivas de pregunta, todas evaluadas en paralelo contra el mismo estado:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Choice: elige entre opciones predefinidas por el desarrollador (ej.
"camera","gaming","battery life"). - Score: devuelve una puntuación sobre una rúbrica ordenada.
- Noul: devuelve una probabilidad entre 0 y 1 de que una afirmación sea cierta.
El resultado incluye, además del valor, la distribución completa de probabilidad y un nivel de confianza. Como el esquema de respuesta lo define el desarrollador antes de llamar, el modelo no puede devolver una opción fuera del conjunto ni un JSON malformado.
Según reportó ADTMag, Jev responde en 70–500 ms, con un precio de US$0,042 por millón de tokens de entrada y sin coste de salida. TypeSafe afirma que, en sus propios benchmarks, fue hasta 193,6 veces más rápido y 444,6 veces más barato que los LLMs con los que lo comparó.
Esas cifras hay que leerlas como vendor benchmarks: TypeSafe reconoció que los flujos que evaluó no formaban parte del set de entrenamiento del modelo, y que los miembros de su equipo de capacidades los crearon ellos mismos.
Por qué un modelo "que no conversa" importa
Jev ataca una categoría nueva: la "AI para máquinas", distinta de la AI conversacional. En lugar de pedirle a un LLM que clasifique, enrute o puntúe y luego validar su JSON, Jev devuelve un valor tipado listo para el flujo de control.
Según GsmDome, en las primeras 24 horas tras su paso por el Vercel AI Gateway, casi el 13% de los equipos de pago de Vercel lo probó: más del doble que cualquier otro modelo reciente en su primer día en esa plataforma. LangChain también lo está evaluando para model routing (mandar tareas simples a un modelo barato y las difíciles a uno capaz) y como filtro previo a acciones riesgosas.
El caso más concreto de adopción: un equipo conectó Jev a una app multi-agente que clasifica transcripciones de recetas. Cuando la transcripción tenía ingredientes y pasos, eligió el agente de recetas en 271 ms; cuando no, eligió el de extracción web en 145 ms.
El caso safe-upgrade: Jev + LangGraph + Tenuo
Tenuo, el equipo detrás del blog donde se publicó el caso, eligió el dominio de actualización de dependencias porque parece mecánico y no lo es. Subir versión, instalar, correr tests y abrir PR funciona… hasta que el release quitó una API que tu repo llama, cambió formato de módulo o alteró un comportamiento que tu suite no ejercita.
Su agente debe interpretar notas de release, relacionarlas con un repo desconocido, decidir qué trabajo hace falta, cambiar código y demostrar que el resultado es correcto. Recibe acceso a archivos, instalación de paquetes, comandos de test, Git y, a veces, al remoto.
La arquitectura separa tres responsabilidades, siguiendo el principio "mantén el componente que recomienda separado del que define su autoridad":
Jev decide entre acciones elegibles. Código determinístico primero calcula las acciones posibles y la razón de cada una; luego Jev elige una y devuelve su confianza.
LangGraph orquesta el flujo. Mantiene estado del repo, hallazgos, decisiones, intentos y evidencia entre nodos, con checkpoints en cada frontera significativa.
Tenuo autoriza cada acción. Cada worker recibe un warrant (permiso) corto y scoped: el que escribe tests solo lee + escribe archivos de test + corre checks; el implementador solo cambia código fuente y actualiza la dependencia exacta; el verificador solo lee.
repository evidence
→ código confiable calcula transiciones elegibles
→ Jev selecciona dentro de ese set tipado
→ código confiable mapea la acción a un worker
→ Tenuo acota el warrant para ese worker
→ herramientas protegidas devuelven evidencia a LangGraph
Un ejemplo concreto del flujo tipado de Jev en el repo, para una decisión "qué hacer ahora":
Choice: author_tests (0.74), assess_verification (0.18), implement (0.08)
Confianza: 0.82
Si la confianza cae bajo el umbral, el flujo toma una ruta determinística de respaldo. No se delega la decisión a un fallback mágico: se delega al código que ya existía.
Por qué esto cambia el juego en CI
El patrón brilla cuando el agente corre desatendido en GitHub Actions. Un job tiene checkout del repo, caché del package manager, un token de GitHub y permiso para comentar o abrir PRs. Los permisos a nivel de job dicen qué puede tocar la identidad del workflow, pero poco sobre por qué este run en particular debería cambiar este paquete, rama o archivo.
safe-upgrade puede evaluar un PR de Dependabot desde su evento o abrir un upgrade verificado como draft. El proceso importa un run warrant firmado por una raíz de confianza que ata el run al paquete y versión exactos, al worktree temporal, a una sola rama y a publicación solo en modo draft. Cada nodo del grafo recibe un child warrant más acotado.
La consecuencia práctica: dos niveles de control sobre el mismo pipeline.
- GitHub Actions: limita la identidad del workflow (ej.
contents: read,pull-requests: write). - Tenuo warrants: limitan cada tarea delegada (herramienta, argumentos, paths, versión de paquete, rama, tiempo de vida).
¿Qué cuenta como "seguro" aquí?
La arquitectura define seguridad como propiedades inspeccionables, no como promesa:
- Decisiones cerradas: Jev elige solo entre transiciones que código confiable ya encontró elegibles.
- Ejecución scoped: cada worker recibe un warrant de corta duración para sus herramientas y argumentos.
- Deberes separados: el que escribe tests, el que implementa, el que verifica y el que publica tienen permisos de escritura distintos.
- Evidencia independiente: la verificación evalúa cada hallazgo mientras los archivos candidatos se mantienen como solo lectura.
- Procesos contenidos: Tenuo autoriza llamadas a herramientas protegidas y un sandbox de sistema operativo limita qué pueden tocar los procesos.
- Incertidumbre explícita: baja confianza, estado desactualizado, violaciones de política o evidencia incompleta devuelven un resultado cualificado o detenido.
Jev puede malinterpretar prosa de release, los checks pueden omitir comportamiento importante y los wrappers confiables pueden codificar una política defectuosa. La idea no es eliminarlos, sino hacer que cada incertidumbre sea visible y acotar las acciones que pueden derivarse.
¿Qué significa esto para tu startup?
Si construyes agentes que tocan producción, la pregunta ya no es solo "qué sabe hacer el modelo" sino "qué puede hacer en mi nombre y durante cuánto tiempo". Separar recomendación (Jev) de autoridad (Tenuo) de orquestación (LangGraph) te da tres puntos de control donde meter política, auditoría y rollback.
Acciones concretas esta semana:
- Audita un agente existente: ¿la decisión y la autorización viven en el mismo componente? Si sí, es tu primer candidato a separar. Empieza por el nodo de mayor blast radius (el que escribe, deploya o cobra).
- Mide cuántas llamadas "de juicio" haces al LLM que podrían ser un
Choiceo unScorede Jev (o una pequeña SVM/clasificador). Si tienes un loop de agente que llama 20 veces por sesión solo para enrutar, cada llamada barata a un decisor tipado es multiplicativa. - Si trabajas en un dominio regulado (salud, finanzas, compliance), la salida tipada de Jev es auditable de forma determinística: el set de respuestas posibles vive en tu código, no en el sampling del modelo. Útil cuando el regulador pregunta "por qué decidiste esto".
Riesgos a tener en cuenta:
- TypeSafe no ha publicado los pesos ni los detalles arquitectónicos completos de Jev, según ADTMag.
- El "Zero Hallucinations" del marketing se refiere a que no puede devolver valores fuera del esquema, no a que acierte siempre. Una respuesta tipada puede ser válida e incorrecta.
- Si pineas
jev-latest, una nueva versión puede cambiar resultados sin tocar tu código. Pinear la versión (jev-1.13.0) es la práctica segura.
Fuentes
- Jev in practice: typed decisions, scoped authority (fuente original)
- Jev Offers Developers an Alternative to Using LLMs for Every Decision
- TypeSafe's Jev Targets AI Decisions Rather Than AI Conversations
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














