Qué es Jev Ultrafast, el agente de navegador de browser-use
Jev Ultrafast es la nueva referencia abierta de browser-use: un agente de navegador basado en el modelo Jev de TypeSafe AI que, según sus autores, completa una búsqueda real en Google Flights (de Zúrich a Londres, 20 de septiembre de 2026) en 7,073 milisegundos de extremo a extremo —incluidos los tiempos del modelo, el texto generado, el trabajo del navegador y las esperas de carga. El repositorio y la documentación se publicaron el 17 de septiembre de 2026.
La diferencia respecto a otros agentes del mercado es su espacio de acciones dinámico e indexado: en cada observación de la página, el agente no recibe una captura ni una lista de selectores CSS, sino una tabla de elementos visibles numerados y etiquetados por tipo (button, combobox, textbox), con su valor actual. A partir de ahí, dos cabezas del modelo —operación y target— deciden en un único round-trip de red qué hacer. Solo se ofrece al modelo la cabeza compatible con el elemento elegido: si la operación es CLICK, el modelo solo puede clicar; si es TYPE_TEXT, entonces un modelo pequeño externo escribe el texto.
El propio GitHub de browser-use lo describe como un agente con un solo objetivo, decisiones tipo-seguras y un LLM pequeño que escribe texto solo cuando es estrictamente necesario. Es un enfoque distinto al de agentes generalistas como ChatGPT Atlas, Comet de Perplexity o Dia, que según el análisis de TechTimes de junio de 2026 están diseñados para ejecutar transacciones autónomas multi-sitio con credenciales del usuario.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadCómo funciona el bucle decisión-ejecución
El repositorio documenta el bucle con un diagrama minimalista que resume toda la propuesta:
- Una observación de página produce una tabla con índices (
[1] button,[2] combobox,[3] textbox…). - Una única petición a TypeSafe devuelve la operación más probable y, a la vez, el target más probable entre los compatibles.
- Si la operación elegida es
TYPE_TEXT, entra en juego un LLM pequeño (en la demo, inception/mercury-2.5 vía OpenRouter, también compatible con Gemini, GLM o DeepSeek por el helper compatible con OpenAI) que escribe el texto que se va a teclear. - El ejecutor resuelve el target desde el nodo DOM real, valida oclusión y frescura, y registra la acción.
Las operaciones disponibles son CLICK, TYPETEXT, SELECT, SCROLLUP, SCROLL_DOWN, WAIT, DONE y BLOCKED. El agente no genera selectores, coordenadas, comandos de shell ni JavaScript ejecutable: la salida del modelo siempre se traduce a un índice sobre la tabla observada.
El diseño se completa con varias garantías operativas documentadas en el README:
- Una llamada al navegador por snapshot. Lee controles visibles, nombres, valores y texto de forma atómica y conserva referencias al DOM real.
- Validación del target. Cada clic re-comprueba documento, valor del formulario, target y contexto cercano; si el control está cubierto, se rechaza antes de la entrada.
- Esperas cortas y acotadas. Tras teclear en un combobox espera sugerencias visibles hasta 200 ms; el resto se limita a dos frames de animación o 50 ms.
- Tabs ocultos siguen renderizando. Se emula el foco para evitar que el throttling del navegador detenga animaciones.
- Reutilización de texto interrumpido. Si la página cambia mientras se genera un texto, el valor generado se conserva siempre que la entrada al helper de texto no haya cambiado.
Resultados de las pruebas: 25% más rápido y 99% menos llamadas al navegador
El repositorio incluye una sección de mediciones con una tarea concreta (búsqueda de vuelos) en seis ejecuciones alternas con los mismos modelos y la misma configuración. Los resultados reportados:
- Tiempo mediano de tarea: de 9,450 s → 7,092 s (un 25% menos).
- Llamadas al protocolo del navegador: de 1,092 → 101 (un 90% menos).
- Tasa de acierto: 3/3 en ambas versiones.
El propio repositorio aclara que esto no es un benchmark general de fiabilidad: son tres repeticiones de una sola tarea en un solo perfil de navegador. La misma política también abrió el artículo de Wikipedia sobre los teoremas de incompletitud de Gödel en 2,798 s y completó una búsqueda y filtrado de hotel en 1,896 s. Las trazas completas, hashes de fuente y límites de medición están en performance.md.
Por qué importa: TypeSafe como nueva capa de decisión
Para entender qué hay detrás del «7 segundos» conviene mirar al modelo que ejecuta la cabeza de decisión. TypeSafe AI salió del stealth el 15 de septiembre de 2026 con una ronda semilla de US$40 millones liderada por DCVC, según Yahoo Finance y SiliconAngle. Forbes, citado por SiliconAngle, valora la compañía en US$200 millones. La empresa está fundada por Diogo Almeida, ex-investigador de OpenAI y coinventor de RLHF/ChatGPT, junto a Erik Gafni y Sasha Sheng.
Su tesis, según el comunicado oficial recogido por Yahoo Finance, es que los modelos conversacionales están optimizados para humanos y eso los hace poco fiables cuando la salida se mete dentro de un sistema en producción: pueden alucinar, cambiar de método entre llamadas y entregar respuestas con confianza injustificada. Jev —el nombre es un guiño a la paradoja de Jevons— es un «System One Model» entrenado con un método que TypeSafe llama Reinforcement Learning for Calibrated Decisions: recibe preguntas estructuradas y devuelve respuestas tipadas (sí/no con probabilidad, selección sobre una lista o puntuación en una escala) acompañadas de una medida de confianza calibrada.
Según el sitio de TypeSafe, Jev entrega resultados por debajo de 100 ms y puede generar cientos de decisiones en paralelo desde un único prompt, a un costo listado de US$0,39 por cada 1.000 workflows, frente a los US$3,31 de GPT-5.6 Luna o los US$19,49 de Claude Haiku 4.5 en la comparativa del propio proveedor. La compañía afirma que en sus pruebas Jev es «casi 194 veces más rápido y unas 445 veces más barato», aunque aclara que esas cifras no se han verificado de forma independiente y variarán según la carga de trabajo, la ubicación de red y el método de comparación.
Jev Ultrafast encaja exactamente en esa tesis: usar el modelo para decisiones estructuradas y fiables (qué botón pulsar, qué opción seleccionar) y delegar la generación abierta de texto a un modelo pequeño separado, manteniendo el bucle rápido y barato.
Qué significa esto para tu startup
El lanzamiento importa por dos razones prácticas. La primera es técnica: para founders que están montando automatizaciones internas sobre sitios de terceros, la métrica de 101 llamadas al protocolo del navegador frente a 1.092 para la misma tarea es la diferencia entre un scraper que un proveedor puede detectar y bloquear, y un agente que se comporta de forma indistinguible de un humano rápido. Cualquier automatización de procesos de back-office que hojea formularios web debería mirar este patrón.
La segunda es estratégica: aparece una capa nueva entre los LLMs conversacionales y el software. Si TypeSafe cumple lo que promete, Jev no reemplaza a GPT o Claude, sino que actúa como capa de decisión embebida —el equivalente a una API de yes/no con probabilidad— que se enchufa dentro de cualquier workflow y decide si el sistema sigue, pide más información o escala a un humano.
Tres acciones concretas que puedes tomar esta semana:
- Clonar el repo y correr la demo. El README incluye los comandos (
git clone,uv sync,cp .env.example .env, añadirTYPESAFE_API_KEYyTEXT_MODEL_API_KEY,uv run jev) y abre un inspector local enhttp://127.0.0.1:8766para ver la tabla de elementos, probabilidades y acciones ejecutadas paso a paso. - Probar tu propio flujo. El repositorio expone
examples/flights.py(búsqueda en Google Flights con verificación independiente del resultado) yexamples/run.py(URL + objetivo en lenguaje natural). El primero se ejecuta conuv run --env-file .env python examples/flights.py --keep-open. - Mide antes de decidir. Compara con tu setup actual de browser automation: si hoy tu agente hace cientos de llamadas de protocolo por tarea y dispara costos de modelo, la diferencia entre 1.092 y 101 round-trips puede ser la palanca que justifique migrar.
Fuentes
- Jev Ultrafast: A browser agent with a dynamic, indexed action space (browser-use)
- TypeSafe AI Emerges From Stealth With $40M in Funding With New Model for Composable AI (Yahoo Finance)
- TypeSafe AI exits stealth with $40M to build AI for use by software (SiliconANGLE)
- AI Browser Comparison 2026: Atlas vs. Comet vs. Dia, Ranked by Security and Use Case (TechTimes)
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













