Megakernels 2026: Cursor logra 2.37x más velocidad con Mixture-of-Kittens

Megakernels: la muerte y resurrección de la optimización extrema de IA

El debate sobre los megakernels —kernels de GPU fusionados manualmente que combinan múltiples operaciones— está más vivo que nunca en 2026. Según la discusión técnica en Latent Space, mientras algunos ingenieros declaraban «los megakernels están muertos», Cursor acaba de open-sourcer Mixture-of-Kittens (MoK), un megakernel de entrenamiento MoE que logra hasta 2.37 veces más throughput que las mejores alternativas públicas.

La paradoja es clara: por un lado, expertos como Ali de Waterloo argumentan que «ningún proveedor serio de inferencia usa un kernel de 67k líneas de código fusionado a mano en producción», mientras que por otro, Cursor demuestra que en entrenamiento a gran escala, la fusión radical sigue siendo la única forma de superar cuellos de botella fundamentales.

¿Por qué los megakernels parecían condenados?

Según la discusión técnica en el podcast de Latent Space, hay tres razones principales por las que los megakernels perdieron terreno en inferencia:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

1. La complejidad del desarrollo: Escribir un megakernel optimizado puede llevar meses, y mantenerlo es aún más difícil. Como señaló Ali, «la complejidad del kernel mismo es muy difícil de escribir».

2. La arquitectura Rubin de NVIDIA: El diseño de la próxima generación de GPUs NVIDIA Rubin incluye dependencia triggers a nivel de tile que, según Kyle Kranen de NVIDIA, «mata los megakernels». La nueva arquitectura permite una coordinación más fina de kernels, reduciendo la necesidad de fusión extrema.

3. Paralelización natural: Kernels modulares como TensorRT-LLM que se lanzan en paralelo pueden ser más rápidos porque cada componente se optimiza individualmente y se ejecuta concurrentemente.

La resurrección: Mixture-of-Kittens de Cursor

El 4 de agosto de 2026, Cursor Research open-sourcó Mixture-of-Kittens (MoK), un megakernel de entrenamiento MoE específicamente diseñado para racks GB300 NVL72 de NVIDIA. Según el análisis de explainx.ai, este kernel fusiona toda la comunicación y computación de Mixture-of-Experts en un solo kernel determinístico, logrando:

  • Hasta 2.37x más throughput MXFP8 que la mejor alternativa pública
  • 41% más tokens por segundo en producción end-to-end
  • Funcionamiento completamente determinístico (misma entrada = misma salida bit a bit)

¿Por qué funciona donde otros fallan? Cursor descubrió que en escalas NVL72 (72 GPUs en un solo dominio NVLink), la comunicación entre GPUs, no la computación, era el cuello de botella real. En producción, enviar tokens a los GPUs que contienen sus expertos asignados y recibir los resultados tomaba tanto tiempo como la computación real de los expertos.

La arquitectura que cambia las reglas

MoK utiliza un enfoque híbrido innovador:

Dispatch pull-based, combine push-based: A diferencia de la mayoría de herramientas que usan push en todas partes, MoK mezcla direcciones deliberadamente: dispatch pull-based y combine push-based en el forward pass, y lo inverso en backward.

Sin sincronización CPU-GPU: Utiliza buffers de anillo de tamaño fijo que reciclan memoria en lugar de asignar buffers grandes y mayormente vacíos, evitando la lenta sincronización con las CPUs Grace integradas en GB300.

Un kernel, no una tubería: MoK es un megakernel único donde diferentes SMs se particionan en software en «comp SMs» (ejecutando FFNs de expertos) y «comms SMs» (ejecutando dispatch/combine), señalándose entre sí a través de contadores locales.

¿Qué significa esto para tu startup de IA?

1. Evalúa si la optimización extrema vale la pena para tu caso

  • Si entrenas modelos MoE a gran escala: MoK podría reducir tus costos de entrenamiento en 41% según los números de producción de Cursor
  • Si haces principalmente inferencia: Los kernels modulares como TensorRT-LLM probablemente sean más prácticos
  • Si usas hardware antiguo: MoK está específicamente optimizado para GB300 NVL72 — no es útil sin el tamaño de dominio NVLink o las características CLC de Blackwell

2. Considera el trade-off entre complejidad y rendimiento

  • Desarrollo vs. velocidad: ¿Vale la pena dedicar meses a optimizar un kernel que NVIDIA podría volver obsoleto con su próxima arquitectura?
  • Mantenibilidad: Los kernels fusionados son difíciles de depurar y modificar — ¿tienes el equipo para mantenerlo?
  • Portabilidad: Un kernel optimizado para hardware específico puede no funcionar en tu próximo cluster

3. Aprovecha el open source estratégicamente

MoK está disponible en GitHub con código de benchmark incluido. En lugar de reinventar la rueda:

  • Estudia la implementación para entender los principios de diseño
  • Adapta las ideas a tu stack específico
  • Contribuye mejoras que beneficien a toda la comunidad

El futuro de la optimización de kernels

La discusión sobre megakernels refleja una tendencia más amplia en IA: la automatización está llegando incluso a la optimización de más bajo nivel. Como señala Cursor en su post, «los kernels escritos por IA han mejorado lo suficiente como para que los kernels de operador único optimizados a mano sean cada vez más automatizados».

Esto libera a los equipos pequeños para abordar problemas de sistemas más difíciles y novedosos, como la comunicación MoE a escala NVL72. Para founders, significa que:

  1. El expertise en sistemas distribuidos será más valioso que nunca
  2. La colaboración open source puede acelerar tu roadmap técnico
  3. La especialización en hardware específico ofrece ventajas competitivas sostenibles

Conclusión

Los megakernels no están muertos — están evolucionando. Mientras que en inferencia los kernels modulares ganan terreno gracias a arquitecturas como Rubin, en entrenamiento a gran escala la fusión radical sigue siendo necesaria para superar cuellos de botella fundamentales como la comunicación MoE.

Para startups hispanohablantes, la lección es clara: no optimices prematuramente. Comienza con soluciones estándar, mide tus cuellos de botella reales en producción, y solo entonces considera optimizaciones extremas como megakernels. Y cuando lo hagas, aprovecha el trabajo open source como MoK en lugar de empezar desde cero.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...