Terminal-Bench Science: el nuevo benchmark que mide IA en ciencia

Por qué la IA todavía suspende en el laboratorio

Cuando se mide a los mejores modelos del mundo en flujos de trabajo científicos reales, ni siquiera el más capaz aprueba uno de cada tres intentos. Eso acaba de dejarlo claro Terminal-Bench-Science 0.1, la primera versión de un benchmark abierto lanzado por la Universidad de Stanford y el Laude Institute, el mismo equipo detrás de Terminal-Bench para programación.

El resultado más alto, logrado por Claude Opus 5 con Claude Code, fue de 30,0% de tareas resueltas sobre un set de 70 workflows curados por investigadores. Le siguen GPT-5.6 Sol con Codex en 22,4% y Claude Fable 5 con Claude Code en 21,4%. El modelo open source más fuerte, GLM 5.3, se quedó en 8,1%. Para founders que están construyendo productos verticales con IA, el número importa menos que el mensaje: los agentes de hoy sirven como asistentes, no como científicos.

Qué evalúa exactamente Terminal-Bench-Science

A diferencia de benchmarks tipo examen de opción múltiple, Terminal-Bench-Science se construye a partir de workflows que los propios investigadores hacen en su día a día: análisis de datos científicos, inferencia estadística, simulación, optimización, demostración de teoremas, reconstrucción de imágenes, procesamiento de señales, problemas inversos, calibración de sensores, ajuste de modelos, clasificación y scientific machine learning.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Los 70 casos provienen de cinco dominios: ciencias de la vida, físicas, de la Tierra, matemáticas e ingeniería. Cada tarea se ejecuta en entornos realistas y se califica con tests reproducibles y específicos sobre artefactos concretos: análisis, simulaciones, demostraciones, código o productos de datos. Si el agente no entrega el resultado verificable, no pasa.

La selectividad fue brutal. De 920 propuestas, 464 se aprobaron para implementación y se abrieron 386 pull requests. Solo 70 llegaron al set final. La franja de aceptación refleja lo difícil que es construir tareas que sean interesantes para la ciencia, retadoras para los modelos frontera y lo suficientemente bien especificadas para una evaluación rigurosa.

Por qué el techo baja más de 10 puntos frente a Terminal-Bench

Terminal-Bench-Science está diseñado para separar modelos casi tan bien como Terminal-Bench 3.0, pero baja las tasas de resolución más de 10 puntos porcentuales para todos los modelos evaluados en ambos. La caída no es accidental: durante el proceso de revisión, las tareas se calibraron explícitamente para desafiar a los modelos frontera más recientes.

Para contextualizar el dato, Terminal-Bench-Bench original lleva meses empujando la frontera de los agentes de código. Su sucesora, Frontier-Bench (anteriormente Terminal-Bench 3.0), se desarrolla con Laude Institute y la comunidad Harbor dentro de los Open Benchmarks Grants de Snorkel AI, un compromiso de 3 millones de dólares lanzado en febrero de 2026 para financiar benchmarks abiertos. La propia nota de Snorkel confirma que Terminal-Bench Science está en desarrollo con apoyo de esa misma línea.

Quién gana y quién pierde en el leaderboard

El ranking muestra un patrón claro de dominio de Anthropic y OpenAI en la mayoría de dominios. Claude Opus 5 lidera en todas las áreas excepto en ciencias matemáticas, donde Claude Fable 5 (33,3%) y GPT-5.6 Sol (31,4%) toman los dos primeros lugares. En ciencias de la ingeniería, Grok 4.6 empata con GPT-5.6 Sol en el segundo puesto con 14,8%, a menor costo y menor uso de tokens.

La gráfica de costo-resolución también cuenta su propia historia. Opus 5 alcanza la resolución más alta a mayor costo, con un total de 7.000 dólares para los 70 tasks. GPT-5.6 Sol iguala el rendimiento de Claude Fable 5 a menos de un tercio del costo: 4.200 dólares contra 14.200 dólares. En uso de tokens, Claude Fable 5 iguala a GPT-5.6 Sol consumiendo cerca de una cuarta parte menos (6.400M contra 8.400M).

Solo Kimi K3 y Claude Opus 5 aparecen en ambas fronteras de Pareto, lo que los posiciona como las opciones más equilibradas del set según el eje que se optimice.

El contexto que importa: la IA en ciencia es un campo en plena ebullición

Terminal-Bench-Science no llega en vacío. El mismo día 17 de junio de 2026, OpenAI publicó LifeSciBench, un benchmark de 750 tareas construido con 173 científicos PhD a través de Tacit Labs, donde el mejor modelo (GPT-Rosalind) solo pasó el 36,1% de las tareas. La caída fue aún más marcada cuando los modelos tuvieron que interpretar artefactos como figuras, PDFs y archivos de secuencias genómicas: del 45,1% en tareas solo-texto al 28,1% con artefactos, un desplome de 17 puntos porcentuales.

Por el lado del software empresarial, Microsoft llevó Microsoft Discovery a disponibilidad general durante Build 2026, una plataforma agéntica para generación de hipótesis, experimentación y análisis de datos, con casos en Yale, Pacific Northwest National Laboratory, Ginkgo Bioworks, BHP, Syensqo y GSK. La estrategia es similar a la de Terminal-Bench-Science: agentes que ejecutan, humanos que juzgan.

Y para entender mejor a los modelos que Terminal-Bench-Science evalúa, vale la pena recordar el posicionamiento de Claude Opus 5, lanzado el 24 de julio de 2026. Según Anthropic, Opus 5 se acerca a la inteligencia frontera de Fable 5 a la mitad del precio, gana en Frontier-Bench (43,3% a esfuerzo máximo) y en OSWorld 2.0, y rinde mejor que Opus 4.8 en cada evaluación de ciencias de la vida de la compañía. Valletta Software, que comparó los modelos a fondo, confirmó que Opus 5 es el nuevo default en Claude Max y el modelo más fuerte en Claude Pro, mientras que Fable 5 sigue siendo el techo de capacidad de Anthropic.

Qué significa esto para tu startup

Tres lecturas prácticas para founders que construyen con IA:

  • El estado del arte hoy sirve como asistente, no como reemplazo. Si vendes herramientas a científicos, biotechs o equipos de R&D, el pitch realista sigue siendo: tu producto ahorra horas de trabajo mecánico y deja al científico en el asiento del juicio final. Pretender autonomía total te va a costar credibilidad con el primer error grave del cliente.
  • El benchmark define el estándar de tu marketing. Cuando un lead te pregunte "¿qué tan bueno es su agente?", el benchmark al que podés apuntar ya no es SWE-bench ni HumanEval. Es Terminal-Bench-Science, LifeSciBench o Microsoft Discovery, y todos cuentan la misma historia: 30% resuelto es lo mejor que existe. Si tu producto supera esa franja, el dato vale oro en una pitch deck.
  • El costo por tarea, no el precio por token, es lo que factura el cliente. GPT-5.6 Sol iguala a Claude Fable 5 a menos de un tercio del costo total de evaluación. Si tu arquitectura depende de un modelo caro corriendo 70 tareas en cadena, podés estar perdiendo dos tercios del margen sin saberlo. Mide costo por tarea completa, no por millón de tokens.

Dos acciones concretas esta semana:

  • Audita tu pipeline de IA con una métrica de "costo por workflow terminado", no por llamada a la API. Vas a descubrir dónde se va el margen.
  • Monta una evaluación interna con 5 a 10 tareas reales de tu dominio, versionadas en Harbor si trabajas en código o siguiendo la lógica de Terminal-Bench-Science si trabajas en otro campo. Tener tu propio leaderboard interno es la diferencia entre iterar a ciegas y saber cuándo subir de modelo.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...