Claude Code y Codex se equivocan hasta 10x midiendo el tiempo

Agentes de IA subestiman su propio tiempo: el hallazgo del estudio MATS

Un estudio independiente del programa de investigación MATS evaluó a Claude Code (Anthropic) y Codex (OpenAI) en 218 tareas de programación — 200 del conjunto ProgramBench más 18 diseñadas por los propios investigadores — y encontró que ambos agentes sobrestimaron por entre 3 y 10 veces la duración real de su trabajo, además de mostrar problemas graves para autoevaluar la calidad de sus propios resultados.

La investigación, recogida por The Decoder, expone una limitación operativa directamente relevante para cualquier founder que ya delega código a estos sistemas: estos agentes pueden ejecutar instrucciones, tomar decisiones intermedias y mantener sesiones extensas sin supervisión humana constante, pero no distinguen de forma fiable entre cinco minutos y varias horas de trabajo. Esa ceguera temporal se traduce en costos de cómputo impredecibles, reportes de progreso engañosos e instrucciones con plazos que simplemente no se cumplen.

Qué midió el estudio y por qué importa

Antes de cada ejercicio se pidió a los agentes que estimaran cuánto tiempo tardarían; al terminar, debían reportar cuánto tiempo había transcurrido. El equipo comparó ambas cifras contra la duración registrada por el propio sistema. En ProgramBench, Claude Code y Codex ofrecieron estimaciones cercanas a 90 minutos para la mayoría de las tareas, sin importar su dificultad ni su duración efectiva — un patrón que sugiere que la predicción se guía más por la apariencia y la longitud del prompt que por el contenido real.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Cuando las tareas terminaron en períodos cortos, los errores se acentuaron: Claude se equivocó por 3 veces en promedio, mientras Codex registró errores de 6 a 10 veces respecto del tiempo real. Las predicciones solo se acercaron a la realidad en trabajos que duraron varias horas, lo que refuerza la hipótesis de que estos modelos no tienen una representación interna estable del tiempo, sino patrones influidos por el contexto y la configuración con la que operan.

El harness cambia el resultado aunque el modelo sea el mismo

Un dato contraintuitivo del estudio es que el mismo modelo base se comporta de forma muy distinta según el software que lo gobierna — lo que la industria suele llamar harness, el andamiaje que organiza herramientas, permisos y ciclos de acción. Claude Code, diseñado para continuar hasta completar la tarea, alcanzó una mediana de ejecución cercana a 90 minutos; Codex, en cambio, suele detenerse tras unos 30 minutos casi sin importar el ejercicio. El mismo lenguaje dio, en promedio, 2,5 veces más pasos dentro de Claude Code que dentro de Codex, una brecha que ayuda a explicar por qué las respuestas sobre duración cambian radicalmente entre entornos.

Para un founder esto significa que elegir un agente no es solo una decisión de modelo, sino de orquestador. Un mismo LLM puede consumir horas o detenerse a los 30 minutos dependiendo de cómo esté configurado el wrapper. Comprender el comportamiento por defecto de cada herramienta antes de delegar trabajo crítico es tan importante como comparar benchmarks de capacidad.

La autoevaluación también falla: 20 puntos de exceso

La dificultad no se limita al tiempo. Los modelos más antiguos incluidos en el estudio — Opus 4.8 y GPT-5.5 — sobrestimaron sus propias calificaciones en 20 puntos porcentuales en promedio, y tendieron a puntuarse alto incluso cuando la tarea había fracasado. En un caso documentado, ambos agentes coincidieron en que su trabajo había alcanzado cerca del 70% de éxito, mientras las evaluaciones reales marcaron 7% y 14,5%.

Ese desfase entre la confianza reportada y el desempeño real complica la supervisión humana. Si el sistema informa que una tarea está casi resuelta, el operador tiende a dedicar menos tiempo a revisar, y un error no detectado al inicio puede propagarse al resto del entregable. Confiar en la autoevaluación del agente sin verificación externa es, según el estudio, una fuente de riesgo operacional concreta.

Contexto: qué tan buenos son hoy los agentes de código

El estudio MATS llega en un momento en que los benchmarks de programación autónoma registran avances significativos. El reciente MirrorCode de Epoch AI y METR evaluó a los principales modelos en la reconstrucción de proyectos reales completos sin acceso al código fuente: Claude Opus 4.7 resolvió el 56% de los objetivos, incluyendo una herramienta de bioinformática de 16.000 líneas de Go, con una única tarea que requirió 19 días continuos de cómputo y USD 2.600 de inferencia. GPT-5.5 se colocó segundo en ese ranking, y Gemini 3.1 Pro Preview, tercero con alrededor del 32%, según la cobertura de Tech Times.

En paralelo, MLCommons presentó MLPerf Client v2.0 el 18 de agosto de 2026, una nueva categoría de Agentic AI para medir agentes de ingeniería de software en PC. El estándar incluye escenarios de SWE Agent y Data Analyst Agent, y reporta tiempos desglosados de inferencia y ejecución de herramientas — una señal de que la industria empieza a tomarse en serio el coste real de operar estos sistemas, no solo su capacidad bruta.

Qué significa esto para tu startup

Tres acciones que puedes implementar esta semana:

  • Mide el tiempo desde fuera, no te fíes del agente. Instrumenta cada sesión con un cronómetro o log externo (un simple time antes y después, o un wrapper en tu harness). Tener una fuente de verdad temporal es la diferencia entre entender y malinterpretar los costos de cómputo de tus sesiones largas.
  • Fija límites duros de ejecución. Configura timeouts a nivel de orquestador o de API para cortar sesiones que excedan un presupuesto. El estudio mostró que con una herramienta que informe el tiempo transcurrido, los agentes casi siempre respetan los plazos. Si esa herramienta no existe en tu pipeline, créala como wrapper antes de escalar.
  • Verifica cada entrega con tests independientes. La autoevaluación sobrestima hasta en 20 puntos porcentuales. Un agente que afirma "70% de éxito" puede haber entregado 7%. Mantén una batería de pruebas que no dependa del reporte del propio modelo — esa capa extra es la que separa un demo de un producto en producción.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...