Dust: entrenar transformers sin backpropagation ya es viable

Qué es Dust y por qué importa si entrenas modelos grandes

Dust es un nuevo algoritmo de optimización de orden cero que, según sus autores, es la primera alternativa real a la backpropagation capaz de entrenar transformers de lenguaje desde cero. El paper, publicado por el equipo de qlabs.sh, muestra que Dust no solo iguala a backprop en pérdidas de validación, sino que en varios regímenes de cómputo la supera.

El dato de fondo: desde Rumelhart, Hinton y Williams (1986), toda la deep learning —arquitecturas, optimizadores, hardware— se construyó alrededor de la backpropagation. Si Dust cumple lo que promete, abre la puerta a entrenar redes que hoy son intratables con el método actual.

El truco: población virtual dentro de una sola pasada

Los métodos clásicos de evolution strategies (ES) perturban los pesos del modelo, lo que obliga a materializar cada miembro de la población en su propia pasada hacia adelante. Eso es carísimo: la población está limitada por el número de forward passes que puedas pagar.

¿Y esto cómo se aplica en tu negocio?

En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.

👥 Probar 7 días

Dust hace algo distinto: perturba las activaciones (node perturbation) de forma independiente en cada token. En palabras del paper, cada token se convierte en un miembro virtual de la población, y una sola pasada hacia adelante los evalúa todos en paralelo.

En un transformer moderno, una secuencia tiene unos pocos miles de tokens. Eso significa que cada forward pass evalúa varios miles de miembros de la población simultáneamente —al menos tres órdenes de magnitud más que ES clásico— sin coste adicional de materialización.

Cómo asigna crédito a cada perturbación

El mecanismo de credit assignment de Dust es:

  • Para cada capa lineal, se añade ruido gaussiano a la salida en cada token.
  • Se mide cuánto baja la pérdida en ese token gracias al ruido.
  • La recompensa del ruido se promedia sobre todos los draws para estimar el gradiente en la salida de la capa.
  • El producto externo con la entrada de la capa —que la pasada hacia adelante ya calculó— es el gradiente del peso.

Backprop forma exactamente el mismo producto externo. La única diferencia es que backprop obtiene el error en la salida por la regla de la cadena, y Dust lo obtiene por promediado sobre la población.

Los autores también afinan la asignación de crédito por tipo de capa: las capas de atención (queries, keys, values, gates, embeddings de valores) son recompensadas a través del error estimado en la salida de atención sobre tokens actuales y futuros, no directamente por la pérdida token a token.

Resultados clave: Dust vs backprop vs EGGROLL

El equipo entrenó transformers estilo GPT sobre FineWeb con un tokenizador BPE de 4096 tokens, batch de 16k tokens, una época y SGD con momentum.

A 100k y 1M de tokens, Dust termina por debajo de backprop desde unos pocos cientos a mil draws. A 10M y 20M de tokens, la brecha con backprop se cierra a medida que crece la población:

  • A 10M tokens: la escalera de Dust se aplana y su ajuste la sitúa apenas por encima de backprop.
  • A 20M tokens: la escalera sigue cayendo a 16k draws; el ajuste la coloca en 4.431 (intervalo 95% 3.89–4.58), por debajo del 4.633 de backprop.

Frente a EGGROLL, el estado del arte en ES sobre espacio de pesos, Dust es entre 10³ y 10⁴ veces más eficiente desde 1M de tokens en adelante. Con 256 veces más población, EGGROLL a 16k draws ni siquiera alcanza a Dust a 64 draws. A 1M, 10M y 20M tokens, EGGROLL se queda entre 0.4 y 0.6 por encima de la pérdida de Dust.

El hallazgo contraintuitivo: modelos más grandes son más eficientes en población

La sabiduría convencional dice que los métodos de orden cero no escalan a redes grandes, porque la varianza del gradiente estimado crece con la dimensionalidad. El equipo lo puso a prueba directamente entrenando cuatro tamaños —2M, 7.3M, 38M y 243M parámetros, un rango de 120×— a 10M de tokens fijos.

Población 2.0M 7.3M 38M 243M
64 5.705 5.556 5.558 5.719
256 5.486 5.362 5.358 5.419
1k 5.265 5.161 5.158 5.214
4k 5.189 5.095 5.053 5.124
16k 5.171 5.065 5.036 5.086
Backprop 5.180 5.066 5.015 5.048

Dos observaciones:

  • Modelos más grandes son más eficientes en población, no menos. Desde 256 draws, la pérdida cae de 2M a 7M a 38M parámetros, y el modelo de 243M es solo ligeramente peor. Hasta cierto punto, un modelo más grande gana más con su tamaño de lo que pierde por la varianza.
  • Los modelos grandes siguen mejorando con población donde los pequeños se estancan. Los modelos chicos saturan antes; los grandes siguen mejorando con poblaciones grandes. Pasado 1k draws, los modelos de 38M y 243M ganan cerca de 30% más que los de 2M y 7M.

La interpretación de los autores: el tamaño del modelo es el tamaño y la geometría del espacio de búsqueda. Un modelo más grande tiene un espacio más grande para buscar, lo que le permite aprovechar poblaciones grandes, y potencialmente un paisaje de pérdida mejor condicionado, lo que hace la búsqueda más efectiva incluso con poblaciones pequeñas.

¿Por qué los gradientes de Dust se parecen a los de backprop?

El equipo midió el coseno entre el gradiente estimado por Dust y el de backprop sobre el mismo batch, en checkpoints entrenados con backprop desde 10M hasta 1B de tokens, con poblaciones de 64 a 128k forward passes por paso.

El coseno sube con la población para cada tipo de capa en cada etapa del entrenamiento, y se ajusta a una ley de dos parámetros con RMSE por debajo de 0.06. Los gradientes útiles emergen solo de la población, sin que haya nada de la regla de la cadena construido dentro. La alineación se mantiene a través de dos órdenes de magnitud en tokens a poblaciones grandes, lo que los autores leen como señal alentadora para escalar.

Importante: los gradientes de Dust se acercan a los de backprop en coseno, pero no convergen exactamente a ellos. El estimador apunta en una dirección similar sin ser el gradiente de backprop, lo que da una trayectoria de optimización diferente —y en sus experimentos, a veces mejor que la de backprop.

¿Qué significa esto para tu startup?

Dust no es todavía un reemplazo práctico de backprop en producción. Los autores son explícitos: todavía hacen falta varios órdenes de magnitud más de eficiencia de cómputo antes de que Dust sea una alternativa práctica a backprop a los niveles actuales de cómputo.

Pero si trabajas en infraestructura de IA, fine-tuning o investigación, hay tres implicancias concretas:

  • Si entrenas modelos pequeños o medianos con presupuesto limitado, vale la pena seguir esta línea. Dust es 1000–10000× más eficiente que EGGROLL, y la trayectoria de mejora es clara: a mayor población y más tokens, supera a backprop. La pregunta es cuándo esa ventaja se traducirá en ahorro de cómputo.
  • Si construyes sobre modelos preentrenados y haces fine-tuning, hay técnicas complementarias que ya funcionan en producción con orden cero, como MeZO para adaptar LLMs con solo forward passes. Dust apunta a un régimen más ambicioso: entrenar desde cero sin backprop, lo que podría abrir arquitecturas que hoy son intratables (redes recurrentes, transformers con programa externo en el loop, computación en loop con BPTT difícil).
  • Si haces research en optimización, el paper es un caso de estudio sobre cómo romper creencias establecidas. La sabiduría convencional era que los métodos de orden cero no escalan a redes grandes. La evidencia experimental muestra lo contrario: modelos más grandes son más eficientes en población, no menos. Esa clase de inversión de consenso es donde nacen los próximos saltos de capacidad.

El paper también deja preguntas abiertas que un equipo pequeño puede explorar: ¿Dust encuentra direcciones mejores que el gradiente de primer orden de backprop al explorar el paisaje de pérdida? ¿Cómo co-evolucionan los optimizadores modernos con Dust? ¿Qué arquitecturas nuevas se vuelven entrenables?

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

¿Y esto cómo se aplica en tu negocio?

En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.

👥 Probar 7 días

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...