Lumabri: LLMs descentralizados como Napster, pero para modelos Mixture-of-Experts
Lumabri es un proyecto open-source en C puro que permite ejecutar modelos Mixture-of-Experts (MoE) masivos usando un enjambre de pares (swarm), similar a cómo funcionaba Napster para compartir archivos. El sistema, desarrollado por JustVugg, se integra con el motor colibri y permite que cualquier máquina — con o sin GPU — participe en la inferencia de grandes modelos de lenguaje.
La premisa fundamental: una máquina comparte un modelo, cualquier otra máquina puede chatear con él sin descargar nada por adelantado. Los bytes que la inferencia realmente toca llegan del par en el primer uso y permanecen en un espejo local. La segunda pregunta se sirve desde el disco local a velocidad completa, y el binario del motor no se modifica.
¿Cómo funciona Lumabri? Arquitectura en 5 fases
Fase 1: Compartición de bytes estilo Napster
lumabri serve ejecuta dos programas pequeños: un tracker (solo un índice de quién tiene qué archivos) y un maintainer (sirve rangos de bytes del directorio del modelo). El chatter monta el modelo a través de liblumabri.so, un shim LD_PRELOAD que intercepta las llamadas libc que los motores usan en un directorio de modelo (open, fopen, opendir, pread).
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLos archivos se reflejan como archivos locales dispersos del tamaño real, por lo que fstat, readdir y la caché de páginas del kernel funcionan de forma nativa. Un bloque faltante se obtiene de un par, se escribe en el espejo y luego el pread propio del motor procede. Una lectura caliente cuesta una búsqueda en tabla más una lectura local normal: no hay FUSE ni daemon en la ruta de lectura.
Fase 2: Los pares ejecutan expertos (el avance clave)
En la segunda mitad del proyecto, el chatter mantiene solo los pesos densos, el router y la caché KV, y envía la fila de activación (4 KB) al par que tiene cada experto enrutado. Los pesos de los expertos nunca llegan al chatter. Ambos lados se construyen desde el código fuente del propio motor (expert_node.c incluye olmoe.c), por lo que las ejecuciones locales y remotas son una misma ruta de código y producen tokens idénticos.
Resultados medidos en una máquina con núcleos fijados y red emulada en el par:
| Escenario | tok/s | RSS del chatter |
|---|---|---|
| Local, expertos en RAM | 1.92 | 2.53 GB |
| Local, expertos desde disco | 0.04 | 1.12 GB |
| P2P, LAN gigabit | 5.97 | 1.04 GB |
| P2P, internet a 30 ms | 1.13 | 1.04 GB |
Tokens idénticos en cada ruta. En una LAN, la red cuesta un 15%; en internet, las capas secuenciales son el límite.
Fase 3: La guerra contra el RTT (latencia)
El enjambre es tan rápido como tu réplica más cercana, no tu par promedio. Lumabri mide la distancia y actúa en consecuencia, sin coordinación: cada nodo prueba sus propios pares al inicio (dos PINGs, guarda el mínimo) y el tracker permanece como un índice Napster que nunca sabe dónde está nadie.
- Réplica más cercana primero: pares dentro del 25% + 2 ms del mejor son «igualmente cercanos» y comparten la carga; todos los más lejanos son respaldo, el relay último.
- Lectura anticipada (
LUMABRI_PREFETCH, por defecto 2 bloques): mientras el motor procesa el bloque N, el enjambre ya envía N+1..N+K. - Failover de réplica: un par que muere a mitad de generación cuesta un reintento en la siguiente réplica, no la conversación.
Fase 4: Bootstrap y delegación
Un enjambre debe funcionar el día cero, cuando nadie ha donado nada todavía. La política: el servidor ejecuta primero, delega a medida que llegan donantes y permanece como respaldo de último recurso.
lumabri servetambién ejecuta un nodo experto en todo el modelo (cuando la familia tiene uno).- Los chatters necesitan cero configuración de expertos: el motor pregunta al tracker quién puede ejecutar para el modelo y ejecuta la fase 2 contra quien responda.
- Un donante que se une es descubierto y gana las llamadas para las que está más cerca.
Fase 5: Dos tipos de enjambre
Enjambre abierto: cualquiera puede unirse, nadie es confiable. La integridad es una cadena de custodia arraigada en el operador del enjambre, nunca en el par que sirve los bytes.
Enjambre firmado: ni siquiera el tracker es confiable. Un firma mueve esa autoridad a una clave que el operador mantiene offline.
Enjambre privado: solo por invitación. Establece LUMABRI_TOKEN=S en cada máquina.
¿Qué significa esto para tu startup de IA?
1. Acceso a modelos masivos sin inversión en infraestructura
Lumabri democratiza el acceso a modelos MoE de cientos de miles de millones de parámetros. Si tu startup necesita capacidades de modelos avanzados como DeepSeek V4, OLMoE o GLM pero no tiene presupuesto para GPUs de alta gama, puedes:
- Unirte a un enjambre existente y contribuir con recursos de CPU/almacenamiento
- Crear tu propio enjambre privado entre tus equipos de desarrollo
- Probar modelos grandes en hardware modesto antes de comprometerte con costosos despliegues en la nube
Ejemplo práctico: Un equipo de 5 desarrolladores, cada uno con una máquina de 16 GB RAM y SSD, puede formar un enjambre que ejecute modelos de 500 GB manteniendo solo slices del modelo localmente.
2. Reducción de costos operativos en producción
La arquitectura P2P elimina el cuello de botella del servidor central. Según la documentación de Petals, otro proyecto P2P para LLMs, los sistemas descentralizados pueden reducir costos hasta en un 90% comparado con soluciones centralizadas tradicionales.
Para tu startup, esto significa:
- Escalabilidad orgánica: A medida que más usuarios usan tu servicio, más recursos están disponibles
- Resiliencia: Sin punto único de fallo — si un nodo cae, otros continúan
- Costos predecibles: No pagas por capacidad ociosa en la nube
3. Nuevos modelos de negocio para servicios de IA
La descentralización habilita modelos que antes eran inviables:
- Marketplace de capacidades de inferencia: Usuarios pueden alquilar capacidad de cómputo ociosa
- Servicios de IA comunitarios: Cooperativas donde los usuarios contribuyen recursos a cambio de acceso
- Modelos especializados distribuidos: Diferentes nodos pueden especializarse en diferentes dominios (legal, médico, técnico)
Cómo implementar Lumabri en tu startup (pasos prácticos)
Paso 1: Evaluar tu caso de uso
¿Lumabri es para ti? Considera si:
- Trabajas con modelos MoE grandes (100B+ parámetros)
- Tienes equipo distribuido geográficamente
- Necesitas reducir costos de inferencia
- Valoras la privacidad/soberanía de datos
Casos ideales: Investigación de IA, chatbots empresariales especializados, procesamiento de documentos a escala.
Paso 2: Configurar un enjambre piloto
# En la máquina con el modelo
make
./lumabri serve --model /path/to/model
# En otra máquina (chatter)
./lumabri chat --tracker <server-ip>:7300 --engines-dir /path/to/colibri/c
Requisitos mínimos: Linux, gcc, Python 3 con numpy para fixtures de prueba. Un build de colibri proporciona los binarios del motor.
Paso 3: Planificar la arquitectura de producción
Para despliegue real:
- Servidor central: Hetzner, systemd, firewall (puertos 7300-7302)
- Donantes: Define roles (chat, disco, cómputo) según recursos disponibles
- Seguridad: Usa tokens para enjambres privados, firmas para integridad
- Monitoreo:
/swarmmuestra la red en vivo,/modellista modelos disponibles
Paso 4: Integrar con tu aplicación
Lumabri no es solo para CLI:
- API REST: Envuelve
lumabri chaten un servicio web - Microservicios: Diferentes servicios pueden unirse al mismo enjambre
- Pipeline de datos: Procesamiento distribuido de documentos/lotes
Comparación con alternativas P2P
| Proyecto | Enfoque | Hardware requerido | Determinismo |
|---|---|---|---|
| Lumabri | Expertos individuales (MoE) | Cualquier máquina (CPU/SSD ok) | Byte-identical |
| Petals | Bloques consecutivos de capas | GPU en práctica | Best-effort |
| hivemind | Expertos distribuidos (entrenamiento) | GPU | Varia |
| llama.cpp RPC | Capas en dispositivos propios | Dispositivos controlados | Byte-identical |
La ventaja única de Lumabri: granularidad de experto individual (4 KB activaciones viajan), ningún requisito de GPU, y salida determinista byte-identical.
Limitaciones y consideraciones para 2026
Estado actual del proyecto
Prototipo funcional, desplegable. Enjambres abiertos verifican bytes (sha256 por MiB, firmado por clave ed25519 del operador) y resultados (spot-check en segunda réplica); enjambres privados necesitan token de invitación en todas partes.
No hecho todavía: drafting especulativo con batch-union, requests hedged contra stragglers, asignación de expertos del tracker, rotación/revocación de claves, NAT hole punching.
Consideraciones de rendimiento
- Latencia WAN: Aún significativa para aplicaciones interactivas
- Consistencia: Determinismo facilita verificación pero requiere sincronización
- Descubrimiento: Depende de trackers centralizados (aunque no del procesamiento)
Aspectos legales y regulatorios
Como cualquier tecnología P2P, Lumabri puede usarse tanto para fines legítimos como cuestionables. Para startups:
- Audita qué modelos compartes y con quién
- Implementa controles de acceso adecuados
- Considera implicaciones de soberanía de datos
El futuro de la inferencia descentralizada de IA
Lumabri representa una tendencia más amplia: la descentralización de la infraestructura de IA. Para founders hispanohablantes en 2026, esto significa:
- Menos dependencia de proveedores de nube centralizados
- Nuevas oportunidades para startups que construyan herramientas alrededor de estos ecosistemas
- Acceso más equitativo a capacidades de IA de vanguardia
La pregunta no es si la inferencia P2P llegará, sino cuándo se volverá mainstream. Proyectos como Lumabri, Petals y otros están allanando el camino para un futuro donde la IA no esté controlada por unos pocos gigantes tecnológicos, sino distribuida entre muchos.
Fuentes
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













