Apple Mac mini M6 y Mac Studio M5 Ultra: IA local para devs

Apple rediseña el Mac mini y el Mac Studio para una sola cosa: que corras IA en tu escritorio

El precio de entrada del Mac mini sube a US$899 y el Mac Studio con M5 Ultra arranca en US$5.499. Apple presentó este 25 de agosto una renovación de sus dos desktops junto a dos chips nuevos —el M6 de 2 nm y el M5 Ultra— diseñados específicamente para ejecutar modelos de lenguaje grandes en local, sin pasar por la nube. Para un founder que ya paga cientos de dólares al mes en tokens de Claude o GPT, la pregunta ya no es si la IA local es viable, sino cuánto cuesta dejar de usarla.

Qué trae cada máquina (y qué trae cada chip)

Mac mini con M6 (desde US$899). El M6 es el primer chip de la serie M fabricado en proceso de 2 nanómetros. Por primera vez conviven tres tipos de núcleo en un mismo SoC: 12 núcleos de CPU —dos "super cores", cuatro de rendimiento y seis de eficiencia—, una GPU de 12 núcleos con aceleradores neuronales en cada núcleo y un Neural Engine "dual" de 16 núcleos que duplica el rendimiento en IA frente al M5, según Apple. La memoria unificada llega a 32 GB con 170 GB/s de ancho de banda. Engadget señaló como punto más débil que el Thunderbolt baja a 4 en este modelo (el M5 Pro sí conserva Thunderbolt 5) y que el almacenamiento base se mantiene en 256 GB.

Mac mini con M5 Pro (desde US$1.699). Es el mismo chip del MacBook Pro actual: hasta 18 núcleos de CPU, 20 de GPU y 64 GB de memoria unificada con 307 GB/s de ancho de banda. Pensado para producción de vídeo, game dev y cargas de IA medianas.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Mac Studio con M5 Max (desde US$2.499). Heredado del MacBook Pro: 18 núcleos de CPU, hasta 40 de GPU y hasta 128 GB de memoria unificada. El modelo para creativos y desarrolladores con workloads exigentes.

Mac Studio con M5 Ultra (desde US$5.499). Aquí está la apuesta seria por la inferencia local. Es el primer chip "quad-die" de Apple: dos M5 Max unidos por la capa UltraFusion a 4,4 TB/s. Suma hasta 36 núcleos de CPU, 80 de GPU y 512 GB de memoria unificada con 1,2 TB/s de ancho de banda. La configuración con 512 GB no se enviará hasta finales de octubre. Reserva desde hoy; envío general el 22 de septiembre.

Por qué importa: la inferencia local ya no es un hobby

El movimiento responde a un cambio que Apple no provocó pero está capitalizando. Desde que macOS 26.2 habilitó en diciembre pasado la comunicación de baja latencia entre hosts Thunderbolt 5 para inferencia distribuida con MLX, desarrolladores empezaron a encadenar Mac minis y Mac Studios para correr modelos más grandes que los que caben en una sola máquina. Ars Technica documenta ese patrón como alternativa a los builds multi-GPU con Nvidia.

Las cifras que importan, según pruebas publicadas por Contra Collective con dos Mac Studio M5 Ultra conectados por Thunderbolt 5 ejecutando Llama 4 Maverick cuantizado a 4-bit:

  • 14,2 tokens/segundo en inferencia distribuida con paralelismo de expertos
  • ~740 ms de tiempo al primer token
  • ~220 GB de modelo repartido, ~110 GB por nodo

Es un orden de magnitud más lento que un H100 (que ronda los 71 tok/s con vLLM en la misma referencia), pero habilita algo que antes era imposible en local: correr modelos de 400B parámetros sin nube. Apple, en su briefing con Wired, fue más lejos: asegura que cuatro Mac Studios conectados pueden ejecutar LLMs de más de un trillón de parámetros compartiendo memoria, incluso desde un enchufe de pared estándar.

El contexto de fondo, según el análisis de Codersera sobre Macs como servidores de inferencia: la memoria unificada define el techo. La regla práctica es ~0,5–0,7 GB por billón de parámetros a 4-bit, más 15–25% para KV cache y runtime. Un Mac mini de 24 GB sirve cómodo hasta modelos de 14B; con 64 GB+ ya entran 70B a cuantización agresiva. La RAM no se actualiza después —está soldada—, así que la decisión se toma al comprar.

Qué cambia para los founders que ya usan agentes de IA

El cálculo típico de un founder que delega trabajo de ingeniería a agentes como Claude Code o Codex ronda los cientos de dólares al mes solo en tokens, sin contar el código que no quieres que salga de tu máquina por compliance. La propuesta de Apple es directa: por el precio de un año de inferencia en la nube, compras hardware que la corre en local.

Punto por punto:

  • Coste de entrada. Un Mac mini M6 de 24 GB cuesta US$899. Con Ollama —que desde la versión 0.19 de marzo de 2026 usa MLX por defecto en Apple Silicon, según Codersera— sirve modelos de hasta 14B parámetros a velocidades interactivas.
  • TCO a tres años. Dos Mac Studio M5 Ultra con 512 GB cuestan aproximadamente US$20.000, según Contra Collective. Una instancia 8x H100 en la nube cuesta US$4–6/hora, lo que ronda los US$35.000–50.000 al año en uso continuo. El break-even local aparece sobre el 80% de utilización con horizonte multi-año.
  • Consumo. Apple Silicon en reposo consume pocos vatios; bajo inferencia se mantiene por debajo de los 65 W en el M4 mini y 270 W en el M3 Ultra Studio, según Codersera. El coste eléctrico anual típico está en decenas bajas de dólares.

El trade-off, también según Contra Collective: dos Mac Studios en paralelo añaden 15–25% de latencia frente a un nodo único teórico, y la eficiencia cae al 60–70% cuando escalas a cuatro nodos. No se trata de buscar velocidad bruta, sino de correr modelos que no caben en un solo equipo.

Qué significa esto para tu startup

Si estás evaluando dónde correr tu stack de IA, los nuevos Mac cambian tres ecuaciones concretas:

  1. Privacidad por defecto sin pagar GPU en la nube. Si tu workload toca datos que no pueden salir de tu servidor (salud, finanzas, legal), un cluster de dos Mac Studio M5 Ultra es ahora una arquitectura creíble para correr modelos frontera en local. Ya hay despliegues documentados en comercio regulado, según Contra Collective.
  2. Sustituir gasto en tokens por CapEx amortizable. Si tu equipo gasta más de US$2.000/mes en inferencia de modelos de coding, vale la pena modelar un horizonte a 24 meses. El umbral de payback con un Mac Studio M5 Ultra es alto pero real si el uso se sostiene.
  3. Prototipar agentes sin vendor lock-in. MLX es open source y los modelos open-weight (Qwen, DeepSeek, Llama 4) corren nativamente. Cambiar de proveedor cloud era antes una decisión costosa; cambiar de modelo local es solo descargar otro checkpoint.

Acciones concretas para esta semana:

  • Mide tu gasto real en tokens durante una semana. Anota el modelo, el número de tokens y el coste. Sin esa cifra, cualquier decisión de compra es especulación.
  • Prueba el terreno con Ollama en un Mac mini M6 de 24 GB antes de comprometerte a un Mac Studio. Ollama ahora usa MLX por defecto en Apple Silicon, así que la comparación con LM Studio es más de interfaz que de motor.
  • Si te interesa el clustering distribuido, revisa la documentación de MLX 0.21 (mlx.distributed) y ten claro que vas a necesitar SSH sin contraseña entre nodos, Thunderbolt 5 y deshabilitar sleep en los equipos. Contra Collective documenta los tres puntos donde típicamente fallan los setups: configuración SSH, Thunderbolt bridge que no sobrevive a sleep, y presión de memoria unificada durante el prefill.

El contexto de mercado importa: Apple llevaba meses con el Mac mini y el Mac Studio difíciles de comprar, según Wired. Esta renovación reabre el catálogo y llega cuando la conversación sobre el coste de los modelos frontera en la nube está más caliente que nunca. Para founders que ya construyen sobre IA, el mensaje implícito es claro: corre tu propia infraestructura o paga la nube para siempre.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...