Microsoft alerta: agentes de IA pierden 50% de fiabilidad en tareas largas
El benchmark que rompe la ilusión de los agentes Un estudio de Microsoft Research, difundido a través del benchmark DELEGATE-52, cuantifica algo que muchos equipos técnicos ya sospechaban en silencio: los modelos de frontera se degradan de forma significativa cuando deben sostener cadenas largas de trabajo. Según el estudio, la pérdida promedio de fidelidad documental …









