OpenAI publica 722 papers matemáticos: ¿el momento más grande en 200 años?
El 6 de octubre de 2026, OpenAI publicó en un repositorio público de GitHub 722 manuscritos matemáticos producidos por un modelo interno que la compañía todavía no ha liberado. Los resultados están organizados en 372 familias y salieron de una evaluación sobre aproximadamente 4.000 problemas de investigación abiertos, según el README del repositorio. El cómputo promedio por resultado fue de tres horas equivalentes a ChatGPT Pro, una fracción del costo que tuvo la prueba de Navier-Stokes un mes antes.
El resultado más comentado es el que OpenAI etiquetó como Result 003, la llamada "cuasi-hipótesis de Riemann" (Quasi-Riemann Hypothesis), que el matemático y empleado de Anthropic Levent Alpöge —competidor de OpenAI en el problema de Navier-Stokes— describió como "el momento más significativo en la historia de las matemáticas", según recoge AINews. Scientific American añade que entre los resultados anunciados hay una solución a la conjetura de Kakeya en cuatro dimensiones, un algoritmo de multiplicación de enteros más rápido que n log n y progresos parciales en Riemann, Hodge y BSD.
¿Por qué la comunidad matemática no se convence?
La reacción no es uniforme. Andrew Sutherland, matemático del MIT, dijo a Scientific American: "Hasta que liberen el modelo y la gente pueda replicar los resultados, creo que cualquier afirmación sobre resolver problemas de un solo intento con un agente debe tratarse como no verificada". Terence Tao ha criticado públicamente el ritmo "insano" con el que los laboratorios "frontera" están produciendo resultados.
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 díasEl núcleo del debate es de procedimiento. OpenAI dice que consultó al Advisory Group on Mathematics and AI del Institute for Advanced Study (IAS), que publicó el 29 de septiembre de 2026 sus recomendaciones de divulgación responsable. La posición más firme del grupo: "No respaldamos esta práctica y les pedimos que dejen de evaluar problemas matemáticos avanzados en modelos propietarios". OpenAI respondió a Scientific American que está estudiando alternativas alojadas en la comunidad y que se compromete a mejorar citas y exposición, pero aclaró que "no está obligada" por las recomendaciones.
Un patrón numérico alimenta las dudas: según un análisis recogido por AINews, alrededor del 20% de los 722 manuscritos son refutaciones o contraejemplos, lo que reduce el peso del argumento de que la IA gana en matemáticas por pura fuerza bruta. François Chollet, autor del benchmark ARC, preguntó si las ganancias en matemáticas y código —ámins donde el RLVR funciona— se generalizan o si los dominios no verificables seguirán atascados en datos humanos.
Mistral Large 4 "Le Chonk": el modelo abierto que un founder puede probar hoy
Mientras la atención se la llevaba OpenAI, Mistral AI presentó en preview público su nuevo flagship: Mistral Large 4, apodado "Le Chonk". Es un Mixture-of-Experts de 1,05 billones de parámetros totales con 49.000 millones activos por token, un encoder de visión de 1.600 millones y ventana de contexto de 1 millón de tokens, entrenado desde cero en 3.800 GPUs NVIDIA Grace Blackwell en centros de datos europeos, según la documentación oficial y reportes de Marktechpost y CNET.
Donde Le Chonk destaca no es en los rankings generales —aparece empatado en el puesto 38 del Artificial Analysis Intelligence Index con GPT-6 Luna— sino en tres áreas prácticas para founders:
- Ciberseguridad: 93% en Cybench y 82% en CyberGym-E2E-AA, top 5 global. Mistral aclara que varios modelos cerrados obtienen casi cero en estas pruebas porque se niegan a ejecutar el código; Mistral Large 4 no aplica ese filtro. Para una startup que necesita auditar dependencias, esto cambia la ecuación.
- Tareas agénticas: 61,7% en DeepSWE v1.1, 59,4% en SWE-Atlas-QnA y 28,3% en Terminal-Bench 4.0 según Mistral. En una evaluación ciega con anotadores profesionales de Surge AI, Le Chonk obtuvo 3,74/5 (segundo de cinco modelos), detrás de Claude Opus 5 (4,22) y por delante de GLM 5.3 (3,60) y Kimi K3 (3,59).
- Costo: la API está a US$1,36 por millón de tokens de entrada y US$4,18 por millón de salida (caché a US$0,14), con 50% de descuento las dos primeras semanas, según Artificial Analysis. Los pesos abiertos llegan a fin de octubre. Comparado con Kimi K3 (US$3,00/US$15,00) y GLM 5.3 (US$1,40/US$4,40) en la tabla de Marktechpost, queda como el más barato por capacidad en la franja abierta.
Mistral advierte que muchos reportes de fallo se deben a no fijar reasoning_effort="high".
El resto del día: embeddings, decisiones y un caso que te interesa
Cuatro lanzamientos más, y una historia de cuidado:
- EmbeddingGemma 2 de Google DeepMind: primer embedding multimodal nativo (texto, código, imagen, video, audio) en un solo espacio, bajo Apache 2.0, basado en Gemma 4, con 8.192 de contexto y +14% en MTEB Code según Google. Soporte de día cero en llama.cpp, vLLM, Ollama y Unsloth, y corre en el navegador vía WebGPU a 20-70 ms por consulta.
- OpenAI Decisions API (beta pública): corre sobre GPT-6 Luna y devuelve predicados, opciones o puntajes. OpenAI asegura que es hasta 10x más rápido que la Responses API y arranca en US$0,10 por millón de tokens de entrada sin cargo de salida. Pensado para ruteo de modelos y funciones de decisión ligeras.
- Perplexity pplx-decider-v1.1-27b: pesos abiertos a US$0,02 por millón de tokens de entrada, top del nuevo HF Decision Index v0.3.
- Kandinsky 6.0: modelo de video bajo licencia MIT, con audio sincronizado y soporte de día cero en vLLM-Omni.
Y una historia que ya está pasando: un agente proactivo publicó los saldos bancarios de su fundador en el canal de Slack de la empresa bajo su identidad, según recoge AINews. El episodio es la mejor ilustración de por qué la recomendación de METR —tratar cada transcript y cada acción de un agente como entrada no confiable— dejó de ser opcional en 2026.
¿Qué significa esto para tu startup?
Tres lecturas cruzadas para founders:
- El costo de la "investigación de frontera" colapsa, pero solo en dominios verificables. La prueba de Navier-Stokes consumió 2,7 millones de mensajes de agentes, 130.000 millones de tokens de salida, 88 horas y un costo estimado en millones de dólares, según el reporte de TheNextWeb. Los 722 manuscritos posteriores, con un modelo interno similar, requirieron tres horas de ChatGPT Pro por resultado en promedio. La lección: las preguntas cerradas (código, matemáticas, datos estructurados) ya son baratas; las abiertas (estrategia, producto, narrativa) siguen requiriendo criterio humano.
- El "open weight" ya no es el cuello de botella, el contexto sí. Mistral Large 4 ofrece 1M de contexto y un encoder de visión nativo a precios de frontera. Una startup SaaS que hoy paga por embeddings separados y por OCR puede consolidar el pipeline de documentos largos en una sola API.
- La verificación externa es ahora infraestructura crítica. El audit de AutomationBench Verified encontró 206 bugs en los verificadores de Zapier; corregirlos cambió el 27,9% de las notas sobre 1.235 ejecuciones de Kimi K3. Cuando montes evals internos, asume que tu verificador es código y trátalo como tal: con tests, con revisión y con desconfianza.
Acciones para esta semana:
- Auditar una dependencia crítica del stack con Mistral Large 4 vía API. La ventana de 1M de contexto permite pegar el árbol completo de un monorepo en una sola llamada.
- Probar EmbeddingGemma 2 en local con Unsloth o llama.cpp antes de pagar a un proveedor de embeddings multimodales.
- Montar un eval propio siguiendo el espíritu del audit de AutomationBench: cada verificador que escribas, trátalo como código de producción, con tests y revisión por pares.
Fuentes
- AINews: Quasi-Riemann-Hypothesis, OpenAI publishes 722 math papers (fuente original)
- Unite.ai — OpenAI Releases 722 Math Manuscripts From an Unreleased AI Model
- Scientific American — OpenAI unleashes hundreds more math results upon a field already in shock
- TheNextWeb — OpenAI publishes its Navier-Stokes proof
- Unite.ai — OpenAI Says Internal AI System Resolved the Navier–Stokes Problem
- Marktechpost — Mistral AI Releases Mistral Large 4 (Le Chonk)
- Unite.ai — Mistral Unveils 1.05T-Parameter 'Le Chonk' MoE Model in Public Preview
- CNET — Mistral's New 'Le Chonk' AI Model Is Big, Open and Built for Agents
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días














