Setup local de LLM en M4 Pro Mac mini: Qwen3 + oMLX

Por qué un founder debería correr su propio LLM en un Mac mini

Lawrence本身 analiza su propio flujo de trabajo en un M4 Pro Mac mini con 48 GB de RAM ejecutando un servidor local de LLM para alimentar desde su agente Hermes hasta chats rápidos desde el teléfono, en alrededor de 30 minutos de configuración. Lo que describe no es un experimento: es una alternativa concreta a depender de suscripciones cloud como las que él mismo pagaba (dos planes de US$200 al mes que “cambiaban sin aviso” entre modelos y límites).

La apuesta central: la nube es tierra arrendada. Las APIs cambian precios, imponen topes de uso o intercambian el modelo detrás de escena cuando quieren. Con hardware propio, el costo es la compra del equipo más electricidad: plano, predecible, y cada inferencia es gratis a partir de ahí. Sobre esa decisión gravitan tres ejes — privacidad de datos, soberanía de IA y predictibilidad operativa — que aplican igual a un founder individual que a un equipo en LATAM o España.

El stack exacto que usa: qué hace cada pieza

El setup documentado es deliberadamente minimalista:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Qwen3.6-35B-A3B-OptiQ-4bit como modelo principal para razonamiento y tareas con profundidad.
  • Gemma-4-E4B-it-OptiQ-4bit como modelo ligero para chats simples, formateo y tareas rutinarias.
  • oMLX como servidor de inferencia sobre el Mac mini.
  • Tailscale formando una tailnet privada entre el Mac mini, el iPhone y el MacBook.

El resto de la superficie se compone con Hermes como agente (backend en el Mac mini, cliente desktop en el MacBook, Telegram en el iPhone), Apollo en iOS para chats rápidos, Raycast AI en macOS y Pi como agente de código. Todo apunta al endpoint http://[mac-mini-tailnet-url]/v1 que oMLX expone en el puerto 8000 dentro de la tailnet.

Cómo se lee un identificador de modelo y por qué importa MoE

El autor dedica espacio a desmitificar el etiquetado de los modelos, porque es donde la mayoría de los founders se equivoca al elegir qué puede correr su máquina. La fórmula vale para cualquier modelo moderno:

  • Qwen3.6-35B-A3B-OptiQ-4bit: 35B es el total de parámetros; A3B son los parámetros activos por token (3.000 millones), no 35.000 millones. OptiQ-4bit es cuantización mixta, mayormente 4-bit con 8-bit en capas sensibles.
  • gemma-4-e4b-it-4bit: ~4B parámetros totales, ajustado a instrucciones, cuantización uniforme 4-bit.

La diferencia es operativa. Un modelo denso de 27B mantiene 27.000 millones de parámetros cargados en RAM para cada token. Un MoE como el Qwen3.6-35B-A3B tiene 35.000 millones repartidos en 256 expertos, pero solo ~3.000 millones se activan por token. En el Mac mini de 48 GB, ese modelo ocupa ~20 GB; el Gemma-4-E4B, ~2,4 GB. La regla práctica de la guía ngo-online para Apple Silicon confirma el sweet spot: con 32 GB de Unified Memory se pueden correr modelos MoE de hasta 35B en 4-bit sin entrar en swap a SSD.

La matemática del swap: por qué tu Mac se “muere” si te pasas

La pieza menos documentada y más crítica es el swap a SSD. Cuando el modelo más el contexto exceden la memoria unificada disponible, macOS mueve páginas al SSD y la inferencia cae de ~35 tokens/segundo a un doloroso 0,5–1,5 tokens/segundo. La regla de cálculo según la guía técnica:

  • Tamaño del archivo cuantizado ≈ número de parámetros en GB (35B ≈ 17–20 GB según método).
  • Restar overhead del SO: macOS consume ~6–8 GB en Apple Silicon.
  • Reservar para KV cache: cada miles de tokens suman megabytes; contar 8–16 GB extra si esperas conversaciones largas.
  • Para MoE, mirar parámetros activos, no el total.
  • Dejar un buffer del 10–15% sobre la memoria unificada total.

Un MacBook Air de 16 GB con un denso 27B en 4-bit necesita ~14 GB solo para el modelo; no queda nada para contexto. El mismo MoE 35B-A3B entra porque el footprint activo se parece al de un denso de 6B, mientras los 35B totales quedan en memoria unificada pero sin activarse.

oMLX frente a LM Studio: qué cambia en velocidad y agente

oMLX no es la única opción. Geeky Gadgets lo mide contra LM Studio: ~47 tokens/segundo frente a ~16 tokens/segundo en pruebas con el modelo Qwen 3.6, gracias a los zero-copy arrays que eliminan transferencias redundantes entre CPU y GPU, y a una caché KV de dos capas (memoria unificada para contexto inmediato, SSD para bloques menos activos). El precio de esa velocidad son errores 400 cuando se excede el límite de contexto, que hay que limpiar manualmente.

En el mismo terreno, Ollama publicó un motor MLX rediseñado que, según el medio, entrega ~20% más velocidad de salida que la implementación previa Q4KM y mejora la calidad gracias al formato NVFP4 de NVIDIA: con Gemma 4 12B, la pérdida de calidad frente al original BF16 se reduce a cerca de la mitad respecto a Q4KM. Lo más relevante para founders no es el throughput, sino el sistema de snapshots que almacena estados reutilizables del modelo entre sesiones de agente, ideal para coding assistants tipo Claude Code o Aider que reenvían contexto constantemente.

El benchmark ngo-online resume el catálogo 2026 para 32 GB en Apple Silicon: DeepSeek R1 (distill Qwen3 8B) para razonamiento lógico con cadena de pensamiento visible (~4,3 GB), Muse Glimmer 30B + Dflash 2.6B para tool-use y MCP (~19,7 GB combinados), Qwen 3.6 35B A3B para el día a día (~19 GB), y OpenCode / Qwen-Coder 32B para fullstack coding (~18,5 GB). El autor de la nota original eligió justamente el Qwen3.6-35B-A3B y un Gemma-4-E4B pequeño, cubriendo razonamiento y chat ligero con presupuesto para contexto.

Tailscale + oMLX: la red privada que hace viable el setup

La pieza de red es lo que vuelve al Mac mini accesible desde todos los dispositivos sin abrir nada a internet. Tailscale arma una mesh entre Mac mini, iPhone y MacBook bajo una tailnet privada. oMLX escucha en el puerto 8000 dentro de esa red; Raycast, Apollo iOS, Hermes desktop y cualquier cliente OpenAI-compatible se conectan al mismo endpoint. Resultado: cero configuración duplicada entre dispositivos y cero superficie pública.

Adicionalmente, la persistencia de la caché KV en SSD de oMLX se vuelve decisiva en flujos de agentes. Los coding agents vuelven repetidamente sobre prefijos ya procesados; oMLX restaura esos bloques desde disco en milisegundos en lugar de recomputar, lo que hace práctico correr agentes locales sobre hardware de consumo.

Lo que Alibaba acaba de mover: por qué el gap se cierra

El 3 de agosto de 2026, Alibaba presentó Qwen3.8-Max con 2,4 billones de parámetros y 95.000 millones activos por consulta, según SiliconANGLE. Soporta prompts de hasta 1 millón de tokens (200 páginas de texto o ~100 horas de vídeo por petición) y alcanzó 1.668 puntos en Frontend Code Arena, a solo 37 puntos de la configuración más avanzada de Claude Opus 5. La compañía confirmó que lo open-sourcea junto a una variante más eficiente, Qwen3.8-27B. Para un founder, la señal no es que “Max” corra en un Mac mini — claramente no — sino que la familia Qwen3 ya tiene un escalón de 27B optimizado para hardware de consumo y un techo de 2,4T para cloud. El pipeline desde MoE 35B-A3B local hasta modelos frontera en la nube es hoy del mismo proveedor y de la misma familia.

¿Qué significa esto para tu startup?

El autor lo dice sin adornos: el objetivo no es reemplazar a GPT-5 o Claude Opus, sino cubrir el 80% de las peticiones que no los necesitan. Cuando de verdad los necesitas, ya están disponibles vía API. Lo local absorbe el día a día.

  • Acción 1 — Audita tu factura de IA y clasifica prompts. Separa las tareas rutinarias (resúmenes, reformulación, búsquedas internas, formateo JSON, preguntas de código cortas) de las que sí justifican un modelo frontera. Si las rutinarias superan el 60–70% del total, el ROI de un Mac dedicado aparece rápido frente a dos suscripciones de US$200/mes. El setup documentado corre con un M4 Pro de 48 GB; ya hay en preventa Mac Studio con M5 Max y 128 GB apuntando a modelos 70B en cuantización 4-bit.
  • Acción 2 — Mide antes de comprar. Antes de invertir en hardware, valida el caso en tu propio laptop. Modelos como DeepSeek R1 distill 8B (~4,3 GB) o Gemma-4-E4B (~2,4 GB) corren en máquinas con 16 GB y sirven para validar prompts, pipelines y la integración con tus herramientas. Cuando el prototipo funcione, saltas al sweet spot de 32–48 GB con MoE 35B. La barrera de entrada es una tarde de configuración, no una decisión de infraestructura irreversible.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...