Ai2 publica Olmo-core 3: 2,7x más rendimiento en MoEs

Por qué Olmo-core 3 importa aunque no entrenes tu propio LLM

El Allen Institute for AI (Ai2) liberó Olmo-core 3, una infraestructura abierta para entrenar a escala modelos Mixture of Experts (MoE), la arquitectura que activa solo unos pocos ‘expertos’ especializados para cada token en lugar de procesar el modelo completo. En una prueba preliminar con 8 GPUs NVIDIA B300, un MoE de 47.000 millones de parámetros procesó 52.000 tokens por segundo por GPU, frente a los 19.400 de la versión anterior: aproximadamente 2,7 veces más rendimiento, según datos publicados por Ai2 en su blog oficial.

El dato relevante para un founder no es el rendimiento bruto sino el tipo de cálculo que hace posible. Entrenar un MoE de gran tamaño exigía hasta ahora mover enormes cantidades de pesos entre GPUs en cada lote, vaciando parte del beneficio computacional que justifica la arquitectura sparse. Ai2 reporta que, en uno de sus benchmarks, logró pasar de 8 a 128 expertos manteniendo solo 4 activos por token (unos 3,2 mil millones de parámetros activos por token), mientras la capacidad total crecía de 4,6 a 47 mil millones de parámetros y el rendimiento caía menos del 5%.

Qué cambia respecto a la versión anterior

El núcleo técnico es el cambio de Fully Sharded Data Parallel (FSDP) a una arquitectura basada en Distributed Data Parallel (DDP). En la práctica, los expertos se quedan residentes en sus GPUs y los datos viajan hacia ellos, en lugar de reunir y redistribuir los pesos completos del modelo en cada mini-batch.

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad

Ai2 combinó tres técnicas de paralelismo para escalar MoEs sin exigir que cada GPU almacene el modelo entero y su estado de entrenamiento:

  • Expert parallelism: reparte los expertos entre GPUs; cada una guarda solo una parte del pool.
  • Pipeline parallelism: divide las capas del modelo entre grupos de GPUs, reduciendo la memoria por dispositivo.
  • Distributed optimizer: dispersa el estado del optimizador entre GPUs en lugar de replicarlo completo en cada una.

A esto se suman tres optimizaciones de enrutamiento y cómputo: rowwise expert parallelism (coloca los datos directamente en los buffers de los expertos), routing residente en GPU (la CPU puede encolar trabajo sin esperar metadatos) y grouped GEMM (combina muchos cómputos pequeños para que las GPUs los ejecuten de forma más eficiente).

El soporte para MXFP8, un formato de menor precisión relevante para hardware Blackwell, dio una mejora de rendimiento del 21% frente a BF16 en un benchmark controlado sobre 4 GPUs B300, con la memoria activa cayendo de 103 GiB a 95 GiB, según el reporte técnico de Ai2.

El benchmark que Ai2 hizo público

La propia Ai2 probó Olmo-core 3 en configuraciones crecientes. El punto más alto documentado: 1,2 billones de parámetros totales con 58,36 mil millones activos por token, distribuidos en 512 GPUs, con un rendimiento máximo observado de 858 TFLOP/s por GPU. Esos números provienen del reporte técnico publicado junto con el lanzamiento, no de un entrenamiento completo, y se midieron con random routing para evaluar el sistema, no la calidad del modelo resultante.

Ai2 también probó DeepEP v2, un método alternativo de comunicación entre expertos, y alcanzó una configuración de 2,38 billones de parámetros totales en una prueba de capacidad corta, no en un entrenamiento sostenido.

Lo que Ai2 probó y descartó (esto es lo que más te sirve)

El reporte técnico no solo documenta lo que funciona; también lo que no. Varios hallazgos son aplicables a cualquier sistema MoE y pueden ahorrar tiempo a tu equipo:

  • Failure token gerrymandering: una métrica diseñada para premiar el routing balanceado puede mejorar mientras el workload real se vuelve menos balanceado. Si tu equipo usa señales de balance como objetivo, cuidado con qué métrica estás premiando realmente.
  • Bajar la learning rate de los expertos porque procesan menos tokens no mejoró los resultados en la familia de modelos probada. La intuición intuitiva, en este caso, no pagó.
  • El tiempo de cómputo en GPU depende de los valores reales que se procesan, no solo de las dimensiones de la matriz. Comparar rendimiento requiere inputs idénticos, no solo formas idénticas.
  • Solapar comunicación y cómputo en streams separados no siempre acelera el entrenamiento; en algunas pruebas lo ralentizó. Más overlap no es sinónimo de más rendimiento.

Quién está detrás y por qué este lanzamiento es más que un release técnico

Olmo-core 3 llega desde el Allen Institute for AI, fundado por el cofundador de Microsoft Paul Allen en 2014 y conocido por publicar pesos, datos de entrenamiento, código y herramientas de evaluación completas. Según reportó GeekWire, al menos 10 investigadores y líderes de Ai2 (incluido el exCEO Ali Farhadi, la exCOO Sophie Lebrecht y los líderes de investigación Hanna Hajishirzi y Ranjay Krishna) se unieron en meses recientes al equipo de Superintelligence de Microsoft, liderado por Mustafa Suleyman.

Al mismo tiempo, Ai2 mantiene su compromiso abierto: el proyecto OMAI (Open Multimodal AI Infrastructure to Accelerate Science), una iniciativa de 152 millones de dólares respaldada por la NSF y Nvidia, trajo en línea un nuevo cluster de cómputo la semana previa al lanzamiento de Olmo-core 3, según declaró un portavoz de Ai2 a GeekWire. El director del proyecto OMAI es Noah Smith, senior research director de Ai2 y profesor de la Universidad de Washington. El financiamiento principal del instituto proviene del Fund for Science and Technology, una fundación de 3.100 millones de dólares creada según las instrucciones del propio Paul Allen, según GeekWire.

Para un founder que evalúa en qué infraestructura confiar a largo plazo, el matiz importa: Olmo-core 3 es código abierto y reproducible, no un producto comercial sujeto a cambios de roadmap de un proveedor.

Qué significa esto para tu startup

  1. La barrera para entrenar MoEs propios baja. Si tu producto necesita un modelo a medida (dominio legal, médico, científico en español) y descartabas el camino MoE por costo, Olmo-core 3 es un experimento de costo casi nulo para correr sobre hardware Blackwell que ya tengas alquilado. Antes de pagar por una API ajustada a tu caso, mide cuánto costaría entrenar un MoE pequeño con esta infraestructura.
  2. El costo de inferencia en modelos MoE abiertos debería bajar. La eficiencia que Ai2 documenta en entrenamiento suele trasladarse, con cierto rezago, a motores de inferencia como vLLM o TensorRT-LLM. NVIDIA reportó recientemente ganancias de 2,21x en rendimiento con su receta BioNeMo MoE sobre arquitecturas Blackwell, según reportó Blockchain News. Estás a tiempo de diseñar tu arquitectura sobre la premisa de inferencia MoE más barata.
  3. La estrategia de Ai2 es una señal para tu propia estrategia de modelo. El instituto libera pesos, datos y código: ese es el estándar abierto que cada vez más clientes enterprise exigirán. Si tu producto se apoya en un modelo cerrado de frontera, documenta el plan B con un modelo abierto equivalente antes de que un cliente te lo pida en una RFP.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...