Real-SWE: el benchmark que prueba agentes de IA con código privado

Qué es Real-SWE y por qué importa a tu startup

La startup Withspecific presentó Real-SWE, un benchmark que pone a los agentes de IA a trabajar sobre codebases privadas reales, licenciadas de empresas en producción. A diferencia de los benchmarks académicos clásicos, las tareas no son sintéticas ni provienen de repos públicos: son problemas que ingenieros reales resolvieron en su día, con toda la complejidad de sistemas legacy y reglas de negocio.

Los 8 modelos frontera evaluados resuelven apenas entre un 16,2% y un 38,8% de esas tareas. Fable 5.1 (Claude Code) lidera con 38,8%, seguido de GPT-6 Astra (Codex CLI) con 33,8% y Gemini 3.8 Flash (Gemini CLI) con 31,2%. El último es GPT-5.6 Sol, con 16,2%.

Para un founder, el dato clave es este: los agentes de IA todavía no son ese «ingeniero jr. que programa solo» que muchos proveedores prometen. En tareas reales de empresa, fallan casi dos de cada tres veces.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Cómo funciona el benchmark

Real-SWE opera con tres diferenciales que lo separan de SWE-bench y similares:

  • Codebases privadas licenciadas. Los agentes deben navegar sistemas propietarios cuyo código y soluciones no están en internet. El 99% de los tokens en empresas reales están ocultos para los modelos frontera, así que las tareas son nativamente out-of-distribution.
  • Trabajo con consecuencias de negocio. Las tareas incluyen facturación correcta, cálculo de impuestos, migración de clientes y ajustes en reglas de compliance que afectan al producto en producción.
  • Complejidad específica de cada empresa. Cada compañía tiene sus propias convenciones de código, dependencias internas y servicios. El agente tiene que entenderlas para que el cambio funcione.

Los entornos de evaluación combinan servicios reales: AWS, Docker, Kubernetes, PostgreSQL, MySQL, MongoDB, Redis, GitHub, Linear MCP, Slack, Intercom, Google Drive, ClickUp, además de lenguajes como Go, Python, Node.js y TypeScript. La fuente destaca que 6 de cada 10 tareas tienen tasas de resolución inferiores al 15%.

El ranking de modelos en código privado real

La tabla general posiciona a los agentes así:

Posición Modelo Harness Tasa de resolución
1 Fable 5.1 Claude Code 38,8%
2 GPT-6 Astra Codex CLI 33,8%
3 Gemini 3.8 Flash Gemini CLI 31,2%
=5 Grok 4.6 Grok Build 23,8%
=5 Muse Spark 1.3 Muse Code 23,8%
7 Kimi K3 Kimi Code 18,8%
8 GPT-5.6 Sol Codex CLI 16,2%

Las cifras muestran algo importante: el harness importa casi tanto como el modelo. Cada modelo se evaluó con su harness nativo, y los resultados describen la combinación modelo + agente, no el modelo aislado. Es la misma salvedad metodológica que Meta documentó al presentar su modelo Muse Spark 1.3 en septiembre de 2026, cuyo 75,4% en DeepSWE se midió dentro del harness Muse Code, contra el que el modelo fue co-entrenado, según reportó TechTimes.

Costo por tarea: la otra cara del ranking

La fuente también publica el costo estimado por rollout, y los números cambian la conversación:

Modelo Costo estimado (USD)
Gemini 3.8 Flash $2,50
GPT-5.6 Sol $2,65
Muse Spark 1.3 $2,74
Grok 4.6 $3,44
Kimi K3 $3,90
GPT-6 Astra $4,67
GLM 5.3 $5,12
Fable 5.1 $6,96

El modelo más preciso es también el más caro. Fable 5.1 cuesta 2,8 veces más por tarea que Gemini 3.8 Flash, aunque solo resuelve un 7,6% más de tareas. Para founders que evalúan despliegues de agentes a escala, esto obliga a hacer cuentas: ¿compensa pagar $6,96 por un 38,8% de éxito frente a $2,50 por un 31,2%?

Otro dato relevante: el 71,4% de los rollouts de menos de 10 minutos falla, frente al 73,4% de los rollouts largos. La duración no es predictora de éxito: lo que falla es la triagem de múltiples sistemas y la comprensión de reglas de negocio ya existentes en el código.

Por qué los benchmarks tradicionales no cuentan la historia completa

Real-SWE apunta a un vacío bien documentado: SWE-bench, el benchmark más citado para ingeniería de software autónoma, se construyó sobre 12 repositorios Python, según reportó ADTMag en julio de 2026. SWE-bench Multilingual amplió la evaluación a nueve lenguajes, pero solo cubre 300 tareas curadas en 42 repositorios, una muestra mucho más pequeña que la versión original.

Esto significa que los scores de los modelos en benchmarks públicos reflejan entornos muy distintos a los de una empresa con millones de líneas de Java, módulos Maven, inyección de dependencias de Spring o configuración XML legacy. Como señaló John K. Waters en ADTMag: «el rendimiento en benchmarks cae a medida que las evaluaciones se parecen más a la ingeniería de producción».

Real-SWE entra en una hornada de benchmarks que intentan reflejar mejor la realidad: Terminal-Bench evalúa agentes en entornos de línea de comandos; FeatureBench mide desarrollo end-to-end de features en lugar de parches aislados; ABC-Bench prueba tareas backend con configuración de servicios. Todos llegan a la misma conclusión: los modelos frontera rinden peor en tareas reales que en benchmarks públicos.

¿Qué significa esto para tu startup?

El benchmark de Withspecific deja tres lecciones prácticas si estás construyendo o adoptando agentes de código en tu empresa:

  • No compres por el leaderboard. Un 38,8% en Real-SWE no significa «automatiza el 38% de tus tickets». Significa que en tareas reales de facturación, migración o compliance, casi 2 de cada 3 intentos fallarán. Necesitas un humano validando cada cambio.
  • Mide el harness, no solo el modelo. Si tu equipo ya tiene flujos con Claude Code, evalúa cuánto cuesta cambiar a Codex o Gemini CLI antes de migrar. Los scores de Real-SWE describen pares modelo-agente, no modelos aislados.
  • Construye sobre código que el agente pueda leer. Codebases con documentación actualizada, convenciones claras y tests sólidos van a rendir mucho mejor que sistemas legacy mal documentados. Si tu CTO lleva meses diciendo «deberíamos documentar esto», Real-SWE le da la razón.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...