Claude Code y Codex se equivocan hasta 10x midiendo el tiempo
Agentes de IA subestiman su propio tiempo: el hallazgo del estudio MATS Un estudio independiente del programa de investigación MATS evaluó a Claude Code (Anthropic) y Codex (OpenAI) en 218 tareas de programación — 200 del conjunto ProgramBench más 18 diseñadas por los propios investigadores — y encontró que ambos agentes sobrestimaron por entre 3 …









