OpenAI publica 722 teoremas con IA: el mayor corpus verificado

Qué publicó OpenAI exactamente

El 6 de octubre de 2026, OpenAI subió a GitHub el mayor repositorio de manuscritos matemáticos generados por IA jamás publicado: 722 manuscritos agrupados en 372 familias de resultados, todos producidos por un modelo interno no liberado y publicados bajo licencia Apache 2.0 en github.com/openai/math. El modelo que los generó es el mismo sistema frontier —no público— que en septiembre resolvió el problema de las ecuaciones de Navier-Stokes, uno de los siete Problemas del Milenio del Clay Mathematics Institute.

El volumen importa, pero la letra pequeña importa más. Según el catálogo de formalización del repositorio, solo 162 de los 722 manuscritos (~22%) tienen su resultado principal formalizado en Lean, el lenguaje de programación que permite a un ordenador verificar paso a paso que una demostración no tiene errores lógicos. Los otros 560 son manuscritos en lenguaje natural que el propio README de OpenAI advierte: "algunos de los resultados no formalizados podrían tener problemas". Para ponerlo en contexto, Lean 4 Mathlib, la mayor biblioteca pública de matemáticas formalizadas construida por la comunidad, acumula alrededor de 200.000 teoremas en años de trabajo colaborativo. OpenAI añadió 722 nuevos resultados verificados por ordenador en una sola liberación.

El cómputo es real: OpenAI plantea ~4.000 problemas al modelo y conserva los que considera significativos. El cómputo medio por resultado equivale a unas 3 horas de ChatGPT Pro en modo de razonamiento extendido. Para 722 resultados son más de 2.100 horas de inferencia. A los precios de lista de OpenAI, eso son varias decenas de miles de dólares solo en cómputo — sin contar los múltiples intentos fallidos que nunca se publicaron.

Leíste lo que hace la IA. ¿Y en tu negocio?

En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.

👥 Probar 7 días

Por qué Lean cambia la conversación

Lean es un asistente de pruebas: un software que toma un enunciado matemático y una demostración y comprueba mecánicamente que cada paso se sigue lógicamente de los anteriores. No es "IA que parece demostrar algo" — es verificación real, sin ambigüedad. O la prueba es válida y Lean la acepta, o no lo es y el checker la rechaza.

La diferencia con un LLM que "parece" demostrar algo en lenguaje natural es exactamente la misma que entre un compilador y un texto en un editor: uno te garantiza que el programa ejecuta, el otro no. Por eso, aunque el corpus completo (722) es lo que se anuncia, los 162 resultados con Lean son el subconjunto científicamente defendible y el que cualquier equipo de investigación puede revisar con confianza.

OpenAI también publicó 10 resúmenes abreviados del razonamiento del modelo sobre problemas concretos: una región libre de ceros para la función zeta de Riemann, la conjetura de Hodge para variedades abelianas CM, las conjeturas de Mahler, la fórmula de Mézard-Parisi para vidrios de espín diluidos, y el sistema relativista Vlasov-Maxwell en 3D, entre otros. Estos 10 son donde un matemático puede ir a evaluar el tipo de argumento que produce la máquina.

La crítica de la comunidad matemática

La liberación no cayó en saco roto. El AGMAI (Advisory Group on Mathematics and AI) del Institute for Advanced Study publicó el 29 de septiembre de 2026 —una semana antes del lanzamiento— sus recomendaciones para publicaciones responsables, basadas en más de 600 respuestas de la comunidad matemática. La conclusión de AGMAI es dura: "no respaldamos la práctica de probar problemas matemáticos avanzados en modelos propietarios" y pide que los laboratorios dejen de hacerlo.

Las objeciones concretas que están sobre la mesa son tres:

  • Verificación ≠ comprensión. Que un argumento pase el checker de Lean confirma que la lógica es consistente, no que el resultado sea matemáticamente interesante ni que responda la pregunta profunda. El matemático Andrew Sutherland, del MIT, lo resume en Scientific American: "hasta que no liberen el modelo y la gente pueda replicar los resultados, cualquier afirmación sobre resolver problemas con un solo agente debe tratarse como no verificada".
  • Modelos opacos, ciencia opaca. AGMAI pide que para cada resultado se hagan públicos el nombre del modelo, los prompts, un resumen de la cadena de pensamiento, el tiempo empleado y el coste de cómputo. OpenAI publicó cómputo medio y 10 resúmenes, pero no liberó los prompts ni el modelo. El repositorio, además, tiene los Issues desactivados y nunca ha aceptado un pull request — un detalle que varios investigadores (como Keith Adler) señalaron en X.
  • Quién se lleva el crédito. Tristan Buckmaster, matemático de la NYU que trabajaba en Navier-Stokes con Levent Alpöge (investigador de Anthropic), publicó un resultado relacionado el día antes del anuncio de OpenAI. Su queja, recogida por The New York Times y The Verge: que un sistema de OpenAI pudo haber usado su trabajo (almacenado en interacciones con Codex) para llegar a la solución. OpenAI negó acceso a datos específicos pero reconoció que "no podemos descartar que datos de-identificados derivados del uso de nuestros productos hayan ayudado a mejorar nuestros modelos".

Daniel Litt, de la Universidad de Toronto, defiende lo contrario: "no hay razón para pedir a la empresa que mantenga secretas las respuestas a estas preguntas matemáticas". El debate está abierto.

El precedente Navier-Stokes: 88 horas y 10.000 agentes

El corpus de 722 manuscritos no surge de la nada. Es la continuación del anuncio del 8 de septiembre de 2026, cuando OpenAI dijo haber resuelto el problema de Navier-Stokes —que llevaba décadas abierto— usando un modelo interno más capaz que GPT-6 Astra, entrenado desde el 28 de agosto, con 10.000 agentes concurrentes trabajando durante 88 horas. La solución propone que las ecuaciones pueden "romperse" y producir velocidades infinitas en ciertas condiciones (un blow-up). El resultado, con su formalización en Lean, está en revisión por pares, y OpenAI ya dijo que no reclamará el millón de dólares del premio Clay.

Para los matemáticos, que un agente propietario resuelva (o parezca resolver) un Problema del Milenio en 88 horas y publique 722 teoremas adicionales verificados en cuestión de semanas es algo para lo que la profesión no tiene protocolo. La pregunta que dejó AGMAI es la que define el momento: "¿cómo, en esta nueva era, construimos un paradigma que incluya la comprensión humana de las matemáticas como parte de la producción científica responsable?".

Qué significa esto para founders y builders

Lo que OpenAI mostró entre septiembre y octubre de 2026 no es una demo de laboratorio — es la antesala de un producto que cualquiera podrá usar. Tres señales prácticas para quien construye con IA hoy:

  • El razonamiento verificable abre mercados nuevos. Si un LLM puede entregar una demostración en Lean que un checker acepta, el siguiente paso natural es un agente de auditoría que verifique código, contratos financieros o normativas regulatorias con el mismo rigor. El "verificador formal" deja de ser una curiosidad matemática y se convierte en infraestructura de confianza. Estar atento a los movimientos de OpenAI en este segmento es más relevante que seguir cada nueva versión de GPT.
  • La autonomía del agente escala, pero la responsabilidad no. OpenAI habló de "un solo prompt a un solo agente" para los 722 resultados. Eso es el mismo patrón de orquestación que vamos a ver en agentes de operaciones, ventas o soporte en 2026-2027: un prompt, muchos intentos, selección de los que pasan calidad. La pregunta para founders no es "qué puede hacer el agente" sino "qué pasa cuando uno de esos 560 resultados no formalizados resulta estar mal" — y cómo diseñar un loop humano de revisión que no ahogue la velocidad del agente.
  • El científico-augmented es un nuevo rol de producto. Anthropic ya marcó el otro extremo del espectro al publicar la prueba de Fermat (un teorema de 1995 de Andrew Wiles) con sus 13 millones de líneas en Lean, abiertas al público. El contraste es claro: Anthropic formaliza, OpenAI produce. Para un founder construyendo herramientas para investigadores, la oportunidad no es competir con la generación de teoremas sino construir el puente de comprensión humana que AGMAI está reclamando — visualizaciones, resúmenes auditables, búsquedas sobre los resúmenes de razonamiento de 10 manuscritos que OpenAI sí hizo públicos.

El corpus es un logro técnico genuino y la verificación formal con Lean es lo que lo separa del bombo. Pero la comunidad matemática tiene razón en lo esencial: verificación formal no es comprensión. La parte de la matemática que sigue siendo profundamente humana — decidir qué problemas merece la pena atacar y por qué — sigue intacta. Lo que cambió es quién hace el trabajo mecánico de construirlos.

Fuentes

Leíste lo que hace la IA. ¿Y en tu negocio?

En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.

👥 Probar 7 días

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...