Vercel Sandbox ejecuta benchmarks de Harbor y Terminal-Bench

Qué es Harbor y por qué importa Terminal-Bench

Harbor es el framework open-source que está detrás de Terminal-Bench, un benchmark pensado para evaluar agentes de IA en tareas reales de línea de comandos. El registro de Harbor agrupa además otros benchmarks conocidos como SWE-bench, tau3-bench (la variante que la empresa Sierra desarrolla desde 2024) y OSWorld.

La relevancia de este tipo de benchmarks crece a medida que más empresas despliegan agentes en producción. Sierra presentó el 8 de septiembre de 2026 hyper-τ-bench, un benchmark de horizonte largo que mide si los agentes de codificación pueden construir un agente de atención al cliente funcional: el mejor modelo automatizado pasó el 23,9% de las tareas frente al 82,2% de un humano con modelo de frontera, según Sierra. La brecha explica por qué herramientas como Harbor son críticas: si vas a poner un agente a trabajar, necesitas medirlo primero con cargas realistas, no con demos vistosas.

Qué aporta Vercel Sandbox a la ecuación

Vercel Sandbox es un entorno de aislamiento basado en microVMs Firecracker. Lo nuevo, según el changelog de Vercel publicado este 17 de septiembre, es que ahora puedes correr los benchmarks de Harbor en ese entorno pasando el flag --env vercel al comando harbor run.

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad

La ventaja concreta: cada trial del benchmark se ejecuta en su propia microVM aislada, así puedes paralelizar mucho más allá de lo que tu portátil soporta. Donde antes un benchmark Terminal-Bench con n-concurrent 8 en tu laptop podía ser el techo, en Vercel Sandbox ese 8 puede escalar a 80 o 800 trials simultáneos sin que tu máquina colapse.

Vercel no llega nuevo a este espacio. En su conferencia Ship de junio de 2026, la compañía ya había presentado Agent Stack, que agrupa AI SDK, AI Gateway, Vercel Sandbox, Workflow SDK y Chat SDK como un paquete para construir y desplegar agentes. En los últimos meses, los commits disparados por agentes en la plataforma Vercel pasaron de menos del 3% a más del 50%, según cifras que la propia Vercel compartió en Ship, y el volumen de tokens a través de AI Gateway creció de aproximadamente 2 millones a 20 millones en el mismo período.

Seguridad: el firewall hace el trabajo, no la VM

Uno de los puntos más finos del anuncio es la arquitectura de seguridad. Vercel aplica la política de red a nivel del firewall del sandbox, fuera de la VM. Esto tiene dos consecuencias prácticas para los evaluadores de agentes:

  • Las tareas pueden definir qué dominios y endpoints puede contactar el agente sin tocar el código de la microVM.
  • La inyección opcional de credenciales adjunta los secretos a las peticiones salientes que coincidan con el patrón configurado: los secretos nunca entran al sandbox, donde el modelo podría filtrarlos a su log o a su salida.

Cuando evaluas un agente en tu máquina, las API keys viven en tu ~/.zshrc y el modelo tiene acceso a ellas si la tarea se lo pide. En Vercel Sandbox, el modelo solo ve lo que el firewall decide entregarle. Si el benchmark busca medir capacidad real de agente sin fugas, esto cambia las reglas del juego. Y no es marketing: Vercel ejecutó entre el 18 de agosto y el 1 de septiembre un bug bounty de US$1 millón sobre el sandbox que recibió 1.285 reportes, validó 1 crítico, 7 altos y 15 medios, y destinó unos US$325.000 en pagos, según reportó SecurityWeek. Ningún reporte logró acceder a datos de clientes reales.

Cómo encaja AI Gateway en el flujo de benchmarking

El segundo componente clave es AI Gateway, el proxy multi-modelo de Vercel. Con un solo AI_GATEWAY_API_KEY puedes acceder a cientos de modelos de múltiples proveedores. Para quien está benchmarkeando, esto se traduce en un comando idéntico con un --model distinto:

uv tool install 'harbor[vercel]'
export VERCEL_TOKEN="<your-token>"
export AI_GATEWAY_API_KEY="<your-key>"

harbor run -d terminal-bench/terminal-bench-2-1 \
  --agent fx \
  --model vercel_ai_gateway/anthropic/claude-fable-5 \
  --env vercel \
  --n-concurrent 8

Cambias --model a vercel_ai_gateway/openai/gpt-5.6-luna y ejecutas el mismo benchmark contra un modelo distinto. No hay que reescribir scripts de cliente, no hay que mantener varios SDKs, no hay que rotar claves por proveedor. Requiere Harbor 0.22.0 o superior y la guía paso a paso de Vercel cubre setup, configuración y troubleshooting.

¿Qué significa esto para tu startup?

Tres implicaciones concretas si estás construyendo o desplegando agentes:

  • Mide antes de poner en producción. Terminal-Bench, SWE-bench, tau3-bench y OSWorld cubren tareas reales de ingeniería y uso de escritorio. Correrlos en Vercel Sandbox cuesta pocos centavos por trial y te da una foto comparable entre modelos antes de comprometerte con uno para tu producto.
  • Aprovecha el firewall como feature de evaluación. Si tu agente va a tocar APIs internas o datos sensibles, monta el benchmark en Vercel Sandbox, define una network policy estricta y mide no solo si el modelo completa la tarea, sino si respeta los límites. Es una prueba de fuego que tu setup local no te da.
  • Usa Harbor como capa de evaluación reproducible. En lugar de le pedí a GPT que arregló un bug y lo arregló, ten un benchmark versionado, paralelo y trazable. Cuando un modelo nuevo salga la próxima semana, vuelves a correr el mismo comando y comparas contra tu baseline.

Conclusión

Vercel Sandbox no es solo infraestructura aislada: combinado con Harbor y AI Gateway se convierte en un pipeline de evaluación de agentes comparable, paralelo y seguro por diseño. Para los founders hispanohablantes que ya están metiendo agentes en producción, esto baja la barrera para responder la pregunta más cara del sector: ¿este modelo realmente hace lo que necesito, o solo lo parece en mi laptop?

Fuentes

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...