Agentes de IA subestiman su propio tiempo: el hallazgo del estudio MATS
Un estudio independiente del programa de investigación MATS evaluó a Claude Code (Anthropic) y Codex (OpenAI) en 218 tareas de programación — 200 del conjunto ProgramBench más 18 diseñadas por los propios investigadores — y encontró que ambos agentes sobrestimaron por entre 3 y 10 veces la duración real de su trabajo, además de mostrar problemas graves para autoevaluar la calidad de sus propios resultados.
La investigación, recogida por The Decoder, expone una limitación operativa directamente relevante para cualquier founder que ya delega código a estos sistemas: estos agentes pueden ejecutar instrucciones, tomar decisiones intermedias y mantener sesiones extensas sin supervisión humana constante, pero no distinguen de forma fiable entre cinco minutos y varias horas de trabajo. Esa ceguera temporal se traduce en costos de cómputo impredecibles, reportes de progreso engañosos e instrucciones con plazos que simplemente no se cumplen.
Qué midió el estudio y por qué importa
Antes de cada ejercicio se pidió a los agentes que estimaran cuánto tiempo tardarían; al terminar, debían reportar cuánto tiempo había transcurrido. El equipo comparó ambas cifras contra la duración registrada por el propio sistema. En ProgramBench, Claude Code y Codex ofrecieron estimaciones cercanas a 90 minutos para la mayoría de las tareas, sin importar su dificultad ni su duración efectiva — un patrón que sugiere que la predicción se guía más por la apariencia y la longitud del prompt que por el contenido real.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadCuando las tareas terminaron en períodos cortos, los errores se acentuaron: Claude se equivocó por 3 veces en promedio, mientras Codex registró errores de 6 a 10 veces respecto del tiempo real. Las predicciones solo se acercaron a la realidad en trabajos que duraron varias horas, lo que refuerza la hipótesis de que estos modelos no tienen una representación interna estable del tiempo, sino patrones influidos por el contexto y la configuración con la que operan.
El harness cambia el resultado aunque el modelo sea el mismo
Un dato contraintuitivo del estudio es que el mismo modelo base se comporta de forma muy distinta según el software que lo gobierna — lo que la industria suele llamar harness, el andamiaje que organiza herramientas, permisos y ciclos de acción. Claude Code, diseñado para continuar hasta completar la tarea, alcanzó una mediana de ejecución cercana a 90 minutos; Codex, en cambio, suele detenerse tras unos 30 minutos casi sin importar el ejercicio. El mismo lenguaje dio, en promedio, 2,5 veces más pasos dentro de Claude Code que dentro de Codex, una brecha que ayuda a explicar por qué las respuestas sobre duración cambian radicalmente entre entornos.
Para un founder esto significa que elegir un agente no es solo una decisión de modelo, sino de orquestador. Un mismo LLM puede consumir horas o detenerse a los 30 minutos dependiendo de cómo esté configurado el wrapper. Comprender el comportamiento por defecto de cada herramienta antes de delegar trabajo crítico es tan importante como comparar benchmarks de capacidad.
La autoevaluación también falla: 20 puntos de exceso
La dificultad no se limita al tiempo. Los modelos más antiguos incluidos en el estudio — Opus 4.8 y GPT-5.5 — sobrestimaron sus propias calificaciones en 20 puntos porcentuales en promedio, y tendieron a puntuarse alto incluso cuando la tarea había fracasado. En un caso documentado, ambos agentes coincidieron en que su trabajo había alcanzado cerca del 70% de éxito, mientras las evaluaciones reales marcaron 7% y 14,5%.
Ese desfase entre la confianza reportada y el desempeño real complica la supervisión humana. Si el sistema informa que una tarea está casi resuelta, el operador tiende a dedicar menos tiempo a revisar, y un error no detectado al inicio puede propagarse al resto del entregable. Confiar en la autoevaluación del agente sin verificación externa es, según el estudio, una fuente de riesgo operacional concreta.
Contexto: qué tan buenos son hoy los agentes de código
El estudio MATS llega en un momento en que los benchmarks de programación autónoma registran avances significativos. El reciente MirrorCode de Epoch AI y METR evaluó a los principales modelos en la reconstrucción de proyectos reales completos sin acceso al código fuente: Claude Opus 4.7 resolvió el 56% de los objetivos, incluyendo una herramienta de bioinformática de 16.000 líneas de Go, con una única tarea que requirió 19 días continuos de cómputo y USD 2.600 de inferencia. GPT-5.5 se colocó segundo en ese ranking, y Gemini 3.1 Pro Preview, tercero con alrededor del 32%, según la cobertura de Tech Times.
En paralelo, MLCommons presentó MLPerf Client v2.0 el 18 de agosto de 2026, una nueva categoría de Agentic AI para medir agentes de ingeniería de software en PC. El estándar incluye escenarios de SWE Agent y Data Analyst Agent, y reporta tiempos desglosados de inferencia y ejecución de herramientas — una señal de que la industria empieza a tomarse en serio el coste real de operar estos sistemas, no solo su capacidad bruta.
Qué significa esto para tu startup
Tres acciones que puedes implementar esta semana:
- Mide el tiempo desde fuera, no te fíes del agente. Instrumenta cada sesión con un cronómetro o log externo (un simple
timeantes y después, o un wrapper en tu harness). Tener una fuente de verdad temporal es la diferencia entre entender y malinterpretar los costos de cómputo de tus sesiones largas. - Fija límites duros de ejecución. Configura timeouts a nivel de orquestador o de API para cortar sesiones que excedan un presupuesto. El estudio mostró que con una herramienta que informe el tiempo transcurrido, los agentes casi siempre respetan los plazos. Si esa herramienta no existe en tu pipeline, créala como wrapper antes de escalar.
- Verifica cada entrega con tests independientes. La autoevaluación sobrestima hasta en 20 puntos porcentuales. Un agente que afirma «70% de éxito» puede haber entregado 7%. Mantén una batería de pruebas que no dependa del reporte del propio modelo — esa capa extra es la que separa un demo de un producto en producción.
Fuentes
- Agentes de IA no saben cuánto tiempo trabajan y sobrestiman sus tareas – DiarioBitcoin (fuente original)
- AI Solves 56% of Weeks-Long Coding Projects in New Benchmark: MirrorCode – Tech Times
- Claude Code vs ChatGPT Codex: Which AI Coding Agent is Actually the Best in 2026 – Tech Times
- MLPerf Client v2.0 Expands AI PC Benchmarking with Image Generation and Agentic AI – Yahoo Finance
- DeepSWE AI Coding Model Benchmark Finally Solves AI Training Data Contamination – Geeky Gadgets
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













