OpenAI: matemáticos piden pruebas sobre datos de entrenamiento

Por qué este caso importa más que la disputa técnica

En menos de dos semanas, OpenAI ha pasado de celebrar dos hitos científicos notables — la construcción del primer grupo no-sofic (un problema abierto desde 1999) y, según TechCrunch, una solución completa al problema de Navier-Stokes, uno de los siete Millennium Prize Problems del Clay Mathematics Institute, con un premio de un millón de dólares — a ser acusado por dos matemáticos de usar sus conversaciones privadas con ChatGPT como insumo de entrenamiento. La pregunta ya no es si los modelos resuelven problemas abiertos, sino bajo qué condiciones éticas y de propiedad intelectual lo hacen.

El detonante más reciente es una serie de mensajes en Mastodon del matemático Andreas Thom, de TU Dresden, en los que acusa al equipo de matemáticas de OpenAI de haberle dado una respuesta "materialmente engañosa" cuando preguntó si sus intercambios con ChatGPT entraron al pipeline de entrenamiento de Astra, el modelo no liberado de la compañía. Thom es coautor, junto con Gábor Kun, del paper de 2019 en el que se basa directamente la prueba de no-soficidad anunciada por OpenAI el 1 de agosto.

La cronología: del anuncio de Astra a las acusaciones

El 1 de agosto de 2026, según TechTimes, OpenAI publicó los detalles técnicos y los certificados verificables en Lean 4 de diez pruebas originales de su modelo Astra. Una de ellas, la construcción de un grupo no-sofic, respondía una pregunta planteada por Mikhail Gromov en 1999 y se apoyaba explícitamente en el trabajo de Thom y Kun. Días después del anuncio, los matemáticos Francesco Fournier-Facio (Cambridge) y Steven Miller (Yeshiva University) acusaron a OpenAI de subestimar la deuda con esos papers previos — Miller calificó el patrón de "posible mala conducta de investigación", según Scientific American — y la compañía editó silenciosamente su comunicado.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Fue ese episodio el que llevó a Thom a escribir a Sébastien Bubeck, jefe de investigación matemática de OpenAI, y al estadístico de Harvard Mark Sellke, pidiendo aclaraciones. La respuesta de Sellke, según Thom, fue escueta: "eso no ocurrió". Para Thom, la respuesta solo abordaba si sus conversaciones eran accesibles durante la generación de la prueba, no si habían entrado a los datos de entrenamiento, que es lo que él preguntaba.

Lo que dice (y no dice) OpenAI sobre sus datos

En el comunicado sobre Navier-Stokes, OpenAI reconoció explícitamente un matiz que no ofreció a Thom en privado: "es improbable, pero no podemos descartar que datos desidentificados derivados del uso de nuestros productos hayan contribuido a mejorar nuestros modelos". Para Thom, esa distinción demuestra que OpenAI sí entiende la diferencia entre acceso directo a una conversación y entrada al corpus de entrenamiento — exactamente la diferencia que su interlocutor no reconoció.

La objeción técnica de Thom es difícil de desmontar: desidentificar una conversación elimina un nombre, no el contenido intelectual de una idea matemática. Si un usuario intercambia con ChatGPT una demostración parcial de un teorema, y esa interacción alimenta a un modelo que meses después publica el resultado final, el daño a la prioridad científica del autor no se resuelve anonimizando el log.

Thom también señala que optó por desactivar el entrenamiento sobre sus datos el 29 de junio, pero que ese control es prospectivo: no audita conversaciones previas, y el usuario no tiene forma de verificar si el opt-out funcionó.

El precedente Buckmaster-Navier-Stokes y la frase que preocupa

El caso anterior, reportado por TechCrunch el 8 de septiembre, involucra al profesor de NYU Tristan Buckmaster y al investigador de Anthropic Levent Alpöge. Ambos trabajaban con Codex de OpenAI (no en nombre de Anthropic) en avances hacia Navier-Stokes. Cuando su progreso trascendió, OpenAI habría montado en cuestión de días un equipo con un consumo reportado de 300.000 millones de tokens — alrededor de US$22,5 millones a tarifas actuales de Astra — para producir una prueba completa y publicarla primero.

Buckmaster afirma que Bubeck le pidió retirar el crédito de Alpöge en una versión conjunta y, ante la negativa, le dijo textualmente: "¿Por qué arruinarías tu carrera?". TechCrunch recoge que, ante la insistencia de Buckmaster, Bubeck respondió: "Si no quieres que sea amable, no tengo por qué serlo".

La coincidencia de ambos casos en la misma semana reavivó un debate que ya tiene marco institucional: la Declaración de Leiden sobre IA y Matemáticas, publicada el 2 de junio de 2026 con más de 3.000 firmas — incluyendo a los medallistas Fields Terence Tao y Peter Scholze — identifica cinco riesgos del uso de IA en matemáticas (resultados no verificables, citas faltantes, dependencia de sistemas cerrados, claims exagerados y pérdida de independencia científica) que el episodio ilustra punto por punto.

Qué significa esto para tu startup

Aunque el caso parece ajeno a founders que no hacen investigación matemática, deja tres lecciones concretas para cualquier equipo hispanohablante que trabaje con LLMs como insumo de su propio producto:

  • El opt-out de entrenamiento no es un escudo retroactivo. Si tu equipo ha intercambiado ideas técnicas, código propietario o documentos internos con ChatGPT, Claude o Gemini sin desactivar antes el entrenamiento, no hay forma de auditar si ese contenido ya forma parte del corpus. Revisalo en la configuración de cada cuenta y dejá un registro escrito.
  • La "desidentificación" no protege secretos técnicos. Quitar nombres, correos o clientes de un prompt no impide que la estructura del problema, los algoritmos o la lógica de negocio queden en el dataset. Si tu diferencial es un método no público, no lo pruebes contra un LLM comercial hasta tener un acuerdo explícito.
  • Construye trazabilidad propia. El episodio de Buckmaster muestra que, en cuanto un resultado empieza a ser público, los grandes laboratorios pueden llegar antes. Si dependes de descubrimientos originales — propiedad intelectual, papers, patentes — anotá fechas, hashes de borradores y comunicaciones con timestamps verificables. Es la única manera de defender prioridad si alguien publica primero.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...