Nemotron gana oro en IOI y IMO 2026 con SFT y RL

NVIDIA Nemotron alcanza nivel de medalla de oro en IOI 2026 e IMO 2026

El modelo de NVIDIA, Nemotron-3-Ultra-CC, obtuvo 535,4 sobre 600 en la Olimpiada Internacional de Informática (IOI 2026), por encima del umbral de oro de 361,12 y del mejor puntaje humano de la competencia, 498,27. Según el paper publicado en arXiv (2609.02849), se trata de la primera vez que un sistema de IA supera al concursante humano mejor puntuado en un set de problemas de la IOI. En paralelo, una versión especializada de Nemotron 3 Ultra alcanzó 30 sobre 42 puntos en la Olimpiada Internacional de Matemática (IMO 2026), cruzando el umbral oficial de oro de 29. Las pruebas del sistema IMO fueron calificadas por los jueces oficiales de la IMO.

Los dos resultados se construyen sobre una misma idea de fondo: en lugar de entrenar un modelo nuevo para cada dominio, el equipo tomó un modelo base, lo especializó con técnicas de post-entrenamiento estándar y lo combinó con un bucle de inferencia que verifica y refina las respuestas antes de enviarlas.

Qué son IOI e IMO y por qué importan

La IOI 2026, la 38.ª edición, se celebró en Tashkent, Uzbekistán, del 9 al 16 de agosto de 2026, con 386 concursantes de más de 97 países, según la cobertura de la organización. Es la competencia de programación algorítmica más exigente a nivel preuniversitario. La IMO es la referencia equivalente para la resolución de problemas matemáticos con demostración formal. Alcanzar nivel de medalla de oro en ambas coloca al modelo en el percentil más alto de participantes humanos, aunque con una salvedad clave: la nota de NVIDIA en Hugging Face aclara que el resultado de la IOI fue una corrida prospectiva no oficial y no supervisada, no incluida en el ranking oficial de la IOI.

Leíste lo que hace la IA. ¿Y en tu negocio?

En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.

👥 Probar 7 días

La receta de cuatro pasos detrás de los dos oros

Lo que NVIDIA repite en IOI y en IMO es una cadena de post-entrenamiento estructurada en cuatro etapas:

  • Empezar con un modelo base fuerte de la familia Nemotron 3.
  • Curar problemas del dominio y trazas de razonamiento sintéticas de alta calidad.
  • Aplicar post-entrenamiento estándar: ajuste fino supervisado (SFT, por sus siglas en inglés) y, cuando aporta, aprendizaje por refuerzo (RL).
  • Emparejar el modelo especialista con un bucle de inferencia que genera, evalúa y mejora las respuestas candidatas antes de elegir la salida final.

Para programación competitiva, el equipo curó 22.000 problemas y generó trazas sintéticas. A partir de ese corpus entrenó dos especialistas: Nemotron-3-Nano-CC, con 30.000 millones de parámetros totales y 3.000 millones activos, que recibió SFT y RL; y Nemotron-3-Ultra-CC, con 550.000 millones de parámetros totales y 55.000 millones activos, entrenado con SFT únicamente.

IOI 2026: el papel decisivo de GenCorrect

La técnica estrella en programación competitiva se llama GenCorrect: un esquema de cómputo en tiempo de prueba que genera soluciones candidatas, las evalúa, y refina de forma iterativa. Los datos publicados en la IOI 2025 muestran el efecto acumulado de cada etapa. Nemotron-3-Nano-CC pasó de 130 puntos antes del post-entrenamiento a 280 tras SFT y a 291 tras RL; al aplicar GenCorrect llegó a 468 puntos, por encima del umbral de oro de 438,3. Nemotron-3-Ultra-CC alcanzó 502 puntos con la misma estrategia. Esos resultados guiaron la configuración final usada en IOI 2026, donde Ultra-CC sumó 535,4 sobre 600, un puntaje que excede tanto el umbral de oro como al concursante humano mejor clasificado.

IMO 2026: demostrar en lenguaje natural, sin probador formal

En matemáticas, el equipo partió de Nemotron 3 Ultra y entrenó dos especialistas a partir de él: uno con SFT y otro con RL. El corpus de SFT contiene 414.890 ejemplos filtrados por calidad sobre 15.818 problemas únicos de demostración, cubriendo no solo la respuesta final, sino la generación, el refinamiento, la verificación y la meta-verificación de pruebas. El modelo de RL se entrenó con 9.597 problemas seleccionados cerca de la frontera de capacidad del propio modelo. Los dos checkpoints superaron al modelo general en los experimentos de desarrollo, con fortalezas complementarias: el SFT rendía mejor en la primera ronda de búsqueda y el RL en el mejor resultado de un solo checkpoint.

El sistema final, descrito en el paper de IMO 2026, genera pruebas candidatas, las puntúa, produce críticas y refina los intentos más prometedores. Una etapa posterior de alto cómputo selecciona el envío final. Todo el sistema opera en lenguaje natural, sin probador formal, sin herramientas externas y sin acceso a internet, según la publicación. Obtuvo 30 sobre 42 puntos, con pleno crédito en cuatro de los seis problemas, y superó el umbral oficial de oro.

Qué significa esto para tu startup

El dato de marketing de NVIDIA (oro en dos olimpiadas) importa menos que la arquitectura reproducible que hay debajo. Para un founder que construye sobre LLMs, la lección central es esta: el salto de rendimiento no vino de un modelo más grande, sino de co-diseñar datos, post-entrenamiento y un bucle de inferencia que verifica. Las medallas no se obtuvieron con fine-tuning solo ni con muestreo masivo solo; la combinación fue la que cerró la brecha.

Acciones concretas que puedes tomar esta semana:

  • Audita si tu producto tiene un bucle de verificación. Si tu agente genera código, respuestas legales o análisis financiero y los entrega sin un paso explícito de evaluación y refinamiento, estás dejando rendimiento sobre la mesa. Un verificador ligero, aunque sea otro LLM más barato, es la palanca de mayor retorno inmediato en sistemas agentic.
  • Mide cuánto rindió cada etapa de tu pipeline por separado. El experimento de IOI 2025 separa la contribución de SFT, RL y GenCorrect. Haz lo mismo en tu producto: mide baseline, post-entrenamiento, y cómputo en tiempo de inferencia, en ese orden, para saber dónde invertir el próximo esfuerzo.
  • Aprovecha lo que NVIDIA ya libera. El paper de arXiv 2609.02849, los checkpoints de Nemotron-3-Ultra-CC en Hugging Face, el Nemotron-IMO-Bench con 200 problemas de nivel olimpiada, y el repositorio NeMo-Skills con el pipeline de inferencia y los prompts, están disponibles para experimentar sin partir de cero. Es material concreto para construir un benchmark interno o entrenar un especialista en tu dominio con una receta probada.

Fuentes

Leíste lo que hace la IA. ¿Y en tu negocio?

En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.

👥 Probar 7 días

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...