TypeSafe AI levanta US$40M con Jev, el modelo que no es LLM

Jev y TypeSafe AI: el “no-LLM” que enloqueció a la industria en 48 horas

El miércoles se lanzó Jev, el primer modelo de TypeSafe AI, y dos días después acumulaba 36 millones de vistas en su vídeo de lanzamiento (frente a los 74 millones del resultado Navier-Stokes de OpenAI o los 57 millones de Fable 5 de Anthropic), según el resumen diario de Latent Space. La diferencia no es solo de hype: Jev no genera texto. Devuelve probabilidades calibradas sobre opciones que tú defines de antemano. TypeSafe lo llama System One Model y lo entrena 100% con datos sintéticos.

Detrás está Diogo Almeida, ex-investigador de OpenAI que participó en ChatGPT, InstructGPT y RLHF. Fundó TypeSafe en 2024 junto a Erik Gafni y Sasha Sheng. La compañía salió del stealth con US$40 millones en ronda semilla liderada por DCVC y, según Forbes, valorada en US$200 millones. En el comunicado, Almeida resumió así la tesis: “Hemos estado optimizando para humanos, y somos superhumanos agradando a humanos” — pero los sistemas embebidos en software necesitan otra cosa: decisiones estructuradas, no conversación.

¿Qué hace diferente a Jev?

Un modelo discriminativo como Jev no alucina en el sentido clásico porque no genera texto: el usuario define las opciones posibles y el modelo devuelve una probabilidad (sí/no, una lista cerrada, un score de 0 a 1). Cada respuesta trae además una medida de confianza, así puedes decidir cuándo automatizas, cuándo escalas a un humano o cuándo escalas a un LLM más caro.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

TypeSafe reporta:

  • Latencia por debajo de 100 milisegundos en inferencia.
  • Costo de US$0,39 por cada 1.000 workflows, frente a los US$3,31 de GPT-5.6 Luna o los US$19,49 de Claude Haiku 4.5.
  • 194 veces más rápido y 445 veces más barato que modelos de lenguaje comparables, según sus propias pruebas (SiliconANGLE).

Casos reales ya en producción: Vercel sustituyó su clasificador basado en ChatGPT Luna 5.6 por Jev para revisar la seguridad de comandos y reportó resultados 5 a 18 veces más rápidos (TechCrunch). Bryo AI comparó Jev contra Gemini en clasificación de correos corporativos: Gemini fue marginalmente más preciso, pero 10 a 20 veces más caro.

En 48 horas aparecieron 6 clones open source

Como Jev no es open source, la comunidad publicó sus propias reproducciones casi de inmediato. La lista que armó Latent Space:

  • Laya (421M parámetros): encoder ModernBERT-large con dos capas transformer extra que puntúan opciones definidas por el usuario, entrenado con PPO sobre embeddings de secuencia. Devuelve trayectorias de conversión turno a turno.
  • DiffusionGemmaJev: aproximación desde un modelo de difusión. Resultados cercanos en benchmarks.
  • Bespoke Nimble: LoRA sobre Qwen3.5-9B con curación contrastiva de datos sintéticos. En el eval curado, Qwen base pasó del 66% al 90%, frente al 93% de Jev.
  • SemIf (antes OpenJev): backbones causales Qwen3.5 de 4B y 35B con un clasificador NLI de tres clases sobre el último token.
  • Jevlike: embedding ligero de 40K bytes con atención sobre opciones candidatas como queries contra una representación de contexto compartida.
  • Kev-0.5B: adaptador LoRA + cabeza de lectura sobre Qwen2.5-0.5B, tan pequeño que corre en un MacBook Pro.

El propio @ankrgyl confirmó que Jev ya está disponible como modelo de evaluación en Braintrust, con un costo de scoring unas 400 veces menor que configuraciones anteriores.

AGENTS.md se vuelve estándar de facto

El 18 de septiembre, Claude Code v2.1.277 empezó a leer AGENTS.md como fallback cuando no encuentra un CLAUDE.md, con toggle configurable (CryptoBriefing). El formato, tool-agnostic, ya estaba en más de 60.000 repositorios y lo soportan Codex, GitHub Copilot y Gemini CLI. Hasta ahora, quien quería alinear instrucciones entre herramientas tenía que mantener un CLAUDE.md mínimo que importaba AGENTS.md mediante un symlink. Ese truco desaparece.

El matiz importante: la lectura ocurre solo si no existe ningún CLAUDE.md, .claude/CLAUDE.md o CLAUDE.local.md en el directorio de trabajo o sus ancestros. El CLAUDE.md personal en el home, el managed por la organización y los archivos en .claude/rules/ sí se siguen leyendo junto a AGENTS.md (note.com).

El cambio coincide con el paper An Empirical Study of Harness Design for Coding Agents (arXiv 2609.20804), que mantuvo fijo el loop de ejecución y varió solo planificación, espacio de acción y gestión de contexto, comparando 4 modelos y 176 variaciones en SWE-Bench Verified y Terminal-Bench 2.1. La conclusión de los autores: la gestión de contexto sirve sobre todo para evitar fallos por overflow; la planificación es andamio de precisión para modelos débiles y ahorro para los fuertes; y para modelos buenos en bash, usar solo bash es más barato que tools dedicadas.

Anthropic mete evaluadores dentro del laboratorio

El mismo 18 de septiembre, Anthropic anunció su primer evaluador embebido: Accenture, cuya división Faculty (adquirida en enero),estará interno de Anthropic haciendo red teaming, evaluaciones de alineación y test de salvaguardas. Cada empresa invertirá al menos US$1.000 millones en cinco años (TechCrunch, MoneyControl).

El movimiento responde al ensayo de Dario Amodei "We Must Pace the Frontier", publicado el 13 de septiembre, que proponía acceso continuo de tipo empleado a evaluadores externos. Anthropic aclara que la seguridad sigue siendo su responsabilidad — los evaluadores la hacen verificable, no la sustituyen. La estructura es no exclusiva: están en conversaciones con METR y otras nonprofit para pilotar esquemas similares. Las acciones de Accenture subieron 8% tras el anuncio.

En paralelo, California firmó una orden ejecutiva para crear un panel de expertos que recomiende leyes de seguridad más fuertes, incluidos posibles kill switches y monitores externos obligatorios.

Qué significa esto para tu startup

1. Si automatizas clasificación, routing o triage, evalúa un modelo discriminativo. Jev y sus seis clones abiertos cubren el caso típico de un founder SaaS: enrutar tickets, punturar leads, validar comandos, decidir si una alerta merece despertar a alguien. El cálculo de TypeSafe (US$0,39 vs US$3,31 por 1.000 workflows) cambia la economía de productos donde el LLM era un cuello de botella por costo.

2. Consolida tus archivos de instrucciones para coding agents. Si usas Claude Code junto con Codex, Copilot o Gemini CLI, un único AGENTS.md ahora funciona en todos. Revisa si tienes CLAUDE.local.md sin commitear — su presencia desactiva la lectura de AGENTS.md solo en tu máquina. Si quieres leer ambos, configura el setting en Project instructionsclaude-md-and-agents-md.

3. Diseña el harness, no solo el prompt. El paper sobre diseño de harness y la propia filtración de Claude Code (marzo 2026) apuntan a lo mismo: el espacio de herramientas, los presupuestos de turno y la gestión de contexto pesan más que el modelo base. Antes de cambiar de modelo, audita cuántas decisiones del agente están fallando por overflow de contexto, herramientas duplicadas o ausencia de bash.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...