Cómo el auto-research con Codex logró una optimización 232x más rápida en kernels GPU
Sankalp, un desarrollador especializado en optimización de kernels GPU, logró el 12º lugar entre 183 participantes en un concurso de GPU Mode y Core Automation dedicado al auto-research, alcanzando una mejora de rendimiento de 232 veces sobre la solución base. El concurso, parte de la serie "Linear Algebra Kernels in the Age of Research", requería implementar una factorización QR de Householder compacta para matrices cuadradas en batch.
El resultado final fue impresionante: redujo el tiempo de ejecución del kernel desde aproximadamente 419 milisegundos hasta solo 1.805 microsegundos (1,8 ms) en diversas formas de matrices. Este logro no fue producto de semanas de codificación manual intensiva, sino de un proceso sistemático de auto-research o "loop engineering" utilizando modelos de IA como Codex (GPT-5.5) y Claude.
¿Qué es el auto-research y por qué importa para founders tech?
El auto-research representa la próxima frontera en desarrollo de software: sistemas donde agentes de IA no solo generan código, sino que implementan ciclos completos de experimentación, prueba y optimización. En este caso, Sankalp utilizó Codex como ejecutor principal y Claude como asesor estratégico, creando un flujo de trabajo donde los modelos podían:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Analizar resultados de profiling de Modal y NCU
- Generar variantes de kernels en Triton y CUDA
- Enviar automáticamente submissions al leaderboard
- Mantener un registro estructurado de experimentos
- Identificar cuellos de botella como overhead de lanzamiento y panel
Según el artículo de Linxi News, durante los 14 días del concurso, Sankalp realizó más de 1.500 submissions, manteniendo un "beam" de 3-5 candidatos activos para evitar máximos locales. Esta estrategia de diversidad de ideas fue crucial para escapar de optimizaciones marginales y buscar mejoras estructurales.
La ciencia detrás de la optimización: algoritmos bloqueados y tensor cores
El problema específico era implementar QR decomposition mediante Householder reflections, una operación fundamental en álgebra lineal con aplicaciones en optimizadores de entrenamiento de LLMs (como Shampoo-style optimizers) y métodos de precondicionamiento matricial.
El desafío principal: las reflexiones de Householder tienen dependencias seriales que hacen que los tensor cores de las GPUs permanezcan inactivos. La solución implementada fue el algoritmo bloqueado de Householder con actualización WY, que:
- Confina el trabajo serial a un panel estrecho de columnas (32-64)
- Comprime múltiples reflectores en una única actualización de rango-b
- Transforma el trabajo restante en operaciones GEMM (General Matrix Multiply)
- Permite que los tensor cores procesen eficientemente el bloque trailing
Esta transformación es exactamente el tipo de optimización que los agentes de IA pueden descubrir sistemáticamente: convertir problemas seriales en formas matriciales paralelizables.
El flujo de trabajo de auto-research: más que solo prompt engineering
Lo más valioso del caso de Sankalp no es el resultado final, sino la metodología desarrollada. Su workspace incluía:
- AGENTS.md: Instrucciones de alto nivel para el agente, similar al program.md de Karpathy
- Logs estructurados: Registro de cada submission con estado (aceptado/rechazado) y timings por shape
- Beam search discipline: Mantener múltiples familias de ideas activas simultáneamente
- Sub-agents especializados: Para análisis matemático, profiling y búsqueda de bugs
- Integración con herramientas: Modal para profiling, popcorn CLI para submissions
Una lección clave: la expertise de dominio acelera tanto el diseño del harness como la supervisión humana. Sankalp notó que "convertir unknown unknowns en known unknowns" era esencial para formular preguntas efectivas a los modelos.
¿Qué significa esto para tu startup de tecnología?
1. El auto-research ya es viable para problemas específicos de alto rendimiento
Si tu startup trabaja con:
- Procesamiento de señales o imágenes
- Simulaciones numéricas
- Inferencia de modelos de ML optimizada
- Cualquier workload computacionalmente intensivo
Acción concreta: Identifica un kernel o rutina crítica en tu stack que consuma >10% del tiempo de CPU/GPU. Diseña un harness básico con objetivos cuantitativos claros y prueba con Codex o Claude Code.
2. La supervisión humana sigue siendo crítica, pero cambia de rol
Sankalp pasó de escribir código a:
- Diseñar experimentos y definir métricas
- Interpretar resultados de profiling
- Mantener diversidad en el espacio de búsqueda
- Identificar cuellos de botella estructurales
Acción concreta: Capacita a tu equipo en análisis de performance (profiling tools, understanding GPU architectures) más que en optimización manual de bajo nivel.
3. Los costos de experimentación se reducen drásticamente
Con Modal ofreciendo $30 USD mensuales en créditos y suscripciones a Codex/Claude accesibles, puedes realizar miles de experimentos por menos de $500 USD mensuales.
Acción concreta: Establece un presupuesto mensual para auto-research (ej: $200-500 USD) y mide ROI en términos de:
- Reducción de costos de infraestructura
- Mejora en latencia/throughput
- Tiempo de desarrollo ahorrado
4. La documentación y el versionamiento son más importantes que nunca
El workspace de Sankalp incluía 560 variantes de submission, 119 scripts de profiling, y documentación detallada de cada experimento.
Acción concreta: Implementa un sistema de logging automático que capture:
- Prompt exacto utilizado
- Código generado
- Resultados de test/benchmark
- Análisis del agente sobre qué funcionó/no funcionó
Lecciones aprendidas y oportunidades perdidas
Sankalp identificó varias áreas donde podría haber mejorado:
- No explotó distribuciones de input específicas: Casos low-rank tenían muchos ceros que podrían optimizarse
- Uso limitado de instrucciones tensor core: No utilizó tcgen05 de NVIDIA para tensor cores Blackwell B200
- Transiciones de precisión: Podría haber mantenido matrices en fp16 en lugar de mover entre representaciones
Estas son exactamente el tipo de optimizaciones que requieren expertise de dominio profunda y donde los agentes actuales aún necesitan guía humana.
El futuro: agentes especializados y multi-model workflows
El caso demuestra que los workflows híbridos (Claude como advisor + Codex como executor) son efectivos. Según Sankalp, Claude a menudo se rendía después de pocas rondas con excusas como "hemos agotado todas las optimizaciones", mientras que Codex era más persistente.
Predicción para 2026-2027: Veremos emerger:
- Agentes especializados por dominio (GPU kernels, database optimization, compilers)
- Marketplaces de prompts/harnesses para problemas comunes
- Integración nativa en IDEs y herramientas de profiling
Conclusión: el auto-research no reemplaza ingenieros, los potencia
El logro de 232x speedup no fue magia de IA: fue la combinación de:
- Herramientas de IA maduras (Codex, Claude)
- Infraestructura accesible (Modal, GPU Mode)
- Metodología rigurosa (beam search, logging)
- Expertise humana en GPU kernels y álgebra lineal
Para founders hispanohablantes, la oportunidad es clara: mientras Silicon Valley se enfoca en AGI y agentes generales, hay espacio enorme para aplicar auto-research a problemas específicos de LATAM y España - desde optimización de modelos de ML para español hasta kernels personalizados para hardware accesible en mercados emergentes.
La barrera de entrada nunca ha sido más baja: por menos de $500 USD mensuales puedes tener un equipo de "ingenieros de loop" trabajando 24/7 en optimizar tu stack. La pregunta no es si tu startup debería explorar auto-research, sino qué problema crítico de rendimiento vas a asignarles primero.
Fuentes
- Auto-research with codex: How I achieved a 232x Faster Kernel
- AI Auto-Research Yields 232x Speedup in GPU Kernel Optimisation Contest
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













