GPT-5.6 sube al 87% en física tras auditar benchmarks
Qué midió realmente el paper Un equipo de investigación re-auditar con expertos seis benchmarks ampliamente usados para evaluar física —entre ellos HLE-Physics, CMT-Benchmark, UGPhysics, PRISM-Physics, PHYBench y CritPt— descubrió que la mayoría de los fallos atribuidos a los modelos frontera no eran errores de razonamiento físico, sino problemas del propio benchmark: soluciones de referencia incorrectas, …









