Terminal-Bench Science: el nuevo benchmark que mide IA en ciencia
Por qué la IA todavía suspende en el laboratorio Cuando se mide a los mejores modelos del mundo en flujos de trabajo científicos reales, ni siquiera el más capaz aprueba uno de cada tres intentos. Eso acaba de dejarlo claro Terminal-Bench-Science 0.1, la primera versión de un benchmark abierto lanzado por la Universidad de Stanford …









