OpenAI suelta 400 pruebas matemáticas y desata el caos

¿Qué liberó OpenAI exactamente?

Casi 400 resultados matemáticos generados por IA, repartidos en más de 700 manuscritos. Ese es el volumen que OpenAI publicó esta semana y que dejó a la comunidad matemática sin capacidad de reacción. Los trabajos cubren combinatoria, varias ramas de la geometría, teoría de números, informática teórica, álgebra, topología, probabilidad, mecánica estadística y física matemática.

El propio OpenAI tuvo que publicar una guía para navegar su repositorio de GitHub. Varios investigadores consultados por The Verge dijeron que solo leer el índice y los resúmenes —unas 40 páginas— les llevó casi una hora. "Solo repasar la lista completa de resúmenes es abrumador", dijo Álvaro Lozano-Robledo, profesor de la Universidad de Connecticut.

El dato que más incomoda: solo 300 de los 719 manuscritos tenían formalización en Lean, el lenguaje de programación que permite verificar pruebas de forma computacional. Es decir, alrededor del 42%. OpenAI reconoció en GitHub que los resultados están "en distintas etapas de verificación" y que "muchos, pero no todos, los manuscritos han sido formalizados".

¿Y esto cómo se aplica en tu negocio?

En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.

👥 Probar 7 días

Para dimensionar el esfuerzo: el modelo intentó más de 4.000 problemas y un resultado típico consumió alrededor de tres horas de cómputo de razonamiento de ChatGPT Pro, según lo que la propia compañía divulgó. Dan Roberts, responsable de investigación de OpenAI, describió las pruebas matemáticas como un subproducto del testeo interno de modelos, según Interesting Engineering.

La entrega llega después de que la compañía anunciara, el mes anterior, que había resuelto las ecuaciones de Navier-Stokes, uno de los siete Problemas del Milenio del Clay Mathematics Institute, cada uno con una recompensa de US$1 millón, según reportó Interesting Engineering.

¿Por qué los matemáticos hablan de "slop" y de años de trabajo?

"Slop" es el término que se usa para el material generado por IA de baja calidad y frecuentemente erróneo. Los matemáticos temían una "slopocalypse". Y aunque varios admitieron que esta vez OpenAI puso más cuidado que en entregas anteriores, el problema de fondo sigue ahí: sin verificación formal, el único camino es leer papers que a veces son imposibles de seguir.

Kevin Buzzard, profesor del Imperial College London, identificó varios teoremas en su área —teoría algebraica de números— de los que solo unos seis le parecieron destacables de inmediato, y casi ninguno estaba verificado en Lean. "O tengo que leer slop que puede no ser correcto, o esperar a que otros lo hagan, o esperar a que alguien los formalice", dijo a The Verge.

Brendan Hassett, de Brown University, fue más directo: "El escrito del problema que mejor conozco no tenía mucho sentido tras una lectura rápida. Si lo hubiera escrito una persona, no le dedicaría más tiempo. Claro, quedan otros 721 preprints".

Y hubo errores concretos: OpenAI retiró tres papers por un "error de signo" que invalida un argumento, y ya había acumulado revisiones en más de una docena de manuscritos al 8 de octubre.

El impacto humano es lo que más pesa. Scott Armstrong, matemático, dijo que conoce un grupo cuyo programa entero de investigación quedó prácticamente "borrado". Tristan Buckmaster, de NYU, dijo haber escuchado de "tres personas a las que les obliteraron programas de investigación completos". El golpe es más duro para doctorandos e investigadores junior sin plaza fija, cuyas tesis y solicitudes de financiamiento dependen de problemas abiertos que ahora aparecen resueltos.

¿Qué recomendó el grupo asesor y qué ignoró OpenAI?

Antes del lanzamiento, OpenAI trabajó con el Advisory Group on Mathematics and Artificial Intelligence (AGMAI), un grupo de nueve investigadores alojado en el Institute for Advanced Study, según reportó TechCrunch. Las recomendaciones eran claras: publicar papers que un humano entienda, formalizar las pruebas, revelar modelos y prompts, y dejar de usar problemas matemáticos avanzados para testear modelos propietarios.

OpenAI cumplió algunas. Financiará talleres y conferencias para que la comunidad procese el material —sin detallar cuándo ni cómo—, publicó protocolos de revisión y citación, y divulgó más información que en entregas previas. Pero no identificó el modelo que produjo los resultados, no publicó los prompts, no reveló el conjunto completo de problemas intentados y solo incluyó cadenas de razonamiento en 10 de los 719 manuscritos, según TechCrunch.

La reacción más dura vino de la Association for Human Mathematics, cuyo comunicado fue respaldado por el medallista Fields Terence Tao: "Publicar más de 700 archivos de una vez no es una demostración de erudición, es una demostración de poder", recogió Futurism.

También hay una duda técnica seria. Un paper de matemáticos de la University of Cambridge y King's College London documentó al menos dos discrepancias entre la prueba en lenguaje natural y el código Lean de una solución de OpenAI derivada de las ecuaciones de Navier-Stokes. La conclusión, según TechCrunch: que una prueba compile no garantiza que demuestre lo que el paper afirma.

¿Cuánto de esto es realmente nuevo?

Aquí está el matiz que más importa. Jared Duker Lichtman, de Stanford, dijo que hay "decenas" de resultados que calificarían como publicables en revistas de primer nivel, incluyendo avances hacia la hipótesis de Riemann, un caso especial de la conjetura de Hodge y una solución a la conjetura de Kakeya en cuatro dimensiones. En un mundo pre-IA, varios de estos trabajos habrían bastado para consolidar una carrera académica.

Pero Lichtman también señaló que todos los resultados salen de "métodos y técnicas existentes". Llenan partes del mapa conocido en lugar de crear territorios nuevos. Lozano-Robledo coincidió: "Todos usan técnicas existentes de formas muy ingeniosas".

Eso es una buena noticia para cualquiera que construya con IA: el salto no está en magia nueva, está en aplicar lo que ya existe a una escala que ningún equipo humano puede igualar.

¿Qué significa esto para tu startup?

El caso es una clase magistral sobre qué pasa cuando automatizas la producción sin automatizar la verificación. Tres lecciones aplicables:

  • Diseña el pipeline de validación antes del de generación. OpenAI lanzó más de 700 manuscritos con 42% de verificación formal y tres retracciones en días. Si tu producto genera contenido, código o análisis con IA, el cuello de botella no es generar: es revisar. Define qué porcentaje de tu output pasa por un chequeo automático antes de llegar al cliente.
  • La trazabilidad es parte del producto, no un extra. Los matemáticos no pudieron evaluar el trabajo porque faltaban prompts, modelo y contexto. En tu caso, guardar el prompt, la versión del modelo y las fuentes de cada output te da algo que el cliente valora y que te protege cuando algo sale mal.
  • Vende el trabajo de digestión, no solo la respuesta. Varios investigadores argumentan que explicar, verificar y contextualizar resultados debería valorarse más. Ahí hay mercado: herramientas que conviertan output crudo de IA en algo comprensible y auditable tienen demanda inmediata en sectores regulados.

Y una advertencia cultural. Bartosz Naskręcki, de la Universidad Adam Mickiewicz, lo resumió así: "Es un gran desastre. Puede causar un colapso enorme en la cultura académica y simplemente matar a la mayoría de las facultades. Es un problema social y parece que los laboratorios de IA lo están ignorando por completo". Si tu equipo empieza a producir más de lo que puede entender, ya estás dentro de ese problema.

Conclusión

OpenAI demostró que puede generar matemáticas de nivel investigación a un ritmo que ninguna institución humana puede absorber. Lo que no demostró es que pueda hacerlo de forma verificable, atribuida y comprensible. Armstrong lo comparó con una visita extraterrestre: "Si las IA desaparecieran ahora, como si unos alienígenas hubieran venido a la Tierra y se hubieran ido, estaríamos estudiando esto los próximos 10 años".

Para un founder, la lectura es directa: la capacidad de generar ya es un commodity. La ventaja competitiva se movió a la capacidad de verificar, explicar y contextualizar. Quien resuelva ese cuello de botella para su industria tiene un negocio.

Fuentes

¿Y esto cómo se aplica en tu negocio?

En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.

👥 Probar 7 días

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...