Qwen3.8 27B en local: 14 tok/s reales en Mac Studio

Por qué un modelo de 17 GB en local ya no es una rareza

Qwen3.8 27B (Q4KM, 17 GB en disco) genera ~14 tokens/s en un Mac Studio M3 Ultra con 256 GB de memoria unificada, según los benchmarks publicados por Terminalbytes. Su predecesor, qwen3.6:27b, alcanzaba 28,6 tok/s en el mismo equipo. La cifra llama la atención: a primera vista, el nuevo modelo es la mitad de rápido. Pero el autor midió algo que la mayoría de tablas de benchmarks ignora: Qwen3.8 responde en alrededor de un tercio de los tokens, así que el tiempo total por respuesta terminada queda prácticamente empatado (2.058 tokens a 28,6 tok/s son 72 s; 955 tokens a 14,2 tok/s son 67 s).

Este matiz importa mucho para founders que evalúan si pueden mover tareas reales a local en 2026: la velocidad por token es un indicador incompleto, y el contexto de uso pesa más que el pico de tok/s.

Qué es Qwen3.8 27B y por qué se habla tanto de él

Qwen3.8 27B es un modelo denso de 27,3 mil millones de parámetros con arquitectura de atención híbrida (etiqueta qwen35 en el GGUF), contexto nativo de 262.144 tokens, multimodal (imagen y vídeo), y licencia Apache 2.0. La tarjeta del modelo declara 61,7 en SWE-bench Pro y 89,2 en GPQA Diamond, puntuaciones que hace un año habrían sido territorio exclusivo de laboratorios frontera.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

La familia Qwen3.8 llega en dos variantes que conviene distinguir:

  • Qwen3.8-27B (el que cubre este artículo): denso, 27B, corre en hardware de consumo y es open-source.
  • Qwen3.8-Max (anunciado por Alibaba en el WAIC 2026, en julio): 2,4 billones de parámetros totales con 95.000 millones activos por inferencia, según reportó SiliconANGLE el 3 de agosto de 2026. Es MoE sparse, no denso, y la compañía planea open-sourcear la versión más pequeña «la próxima semana» según el anuncio. La promesa de «segundo solo por detrás de Claude Fable 5» no vino acompañada de tabla de benchmarks independiente, según registró TechTimes el 21 de julio.

Para un founder, lo importante es que el modelo pequeño (27B) ya está disponible y es el primero de la familia que se siente como algo más que un juguete, como recogió el autor del hilo más votado en r/LocalLLaMA. En su primera semana, un equipo lo cableó como reemplazo directo de una API de pago en su pipeline de código y reportó que sostenía el ritmo.

Los números crudos: 3.8 vs. 3.6 en la misma máquina

El autor corrió cinco generaciones cronometradas por modelo, prompts técnicos variables, respuestas de 200–500 palabras, usando ollama run --verbose. Ambos modelos con cuantización Q4KM, casi 17 GB en disco.

Métrica qwen3.6:27b qwen3.8:27b
Velocidad de generación (promedio 5 corridas) 28,6 tok/s 14,0 tok/s
Procesamiento de prompt 95,0 tok/s 93,1 tok/s
Dispersión entre corridas 28,5–28,8 (estable) 13,2–15,4
Tokens por respuesta 1.950–3.340 890–1.090

Interpretación honesta: la arquitectura de atención híbrida es nueva y los kernels Metal de Ollama todavía no se han optimizado para ella. La brecha debería reducirse con actualizaciones, igual que pasó con arquitecturas similares en el pasado. Mientras el modelo genera, la CPU apenas se entera: la inferencia corre en GPU vía Metal, con la GPU fijada al 100% absorbiendo ~64 W y la CPU tomando solo 6 W durante la generación.

La cuantización importa más de lo que parece: el experimento de 1-bit

La sorpresa de la semana fue el quant de 1-bit de Unsloth (6,7 GB), bautizado en el subreddit como el «brain damage quant»: un modelo de 27B en la huella de memoria de un 7B. El autor lo probó y la respuesta fue matizada.

309 tok/s de procesamiento de prompt, 27,2 tok/s de generación (casi el doble del Q4). Sobre preguntas factuales (la capital de Australia, el compromiso de Sídney-Melburne), respondió correctamente. Pero al pedirle un one-liner de bash, produjo un comando funcional y luego entró en bucle durante 400 tokens dudando de su propia respuesta, sin comprometerse nunca con una salida final.

Esto coincide con lo que Unsloth publica en su documentación: el quant de 1-bit no debe usarse para trabajo agentico o tool-calling. Su mínimo recomendado para tool-calling es Q2KXL (9,8 GB). La lección práctica: la cuantización no degrada un modelo de forma uniforme; los hechos sobreviven, la decisión se muere. Para «responder trivia rápido en un equipo modesto» funciona. Para cualquier flujo agentico, vale pagar los 3 GB extra del Q2.

Cuánta RAM necesitas según el quant

Quant Tamaño de archivo RAM mínima realista ¿Qué hardware lo corre?
UD-IQ1_M (1-bit) 6,7 GB 16 GB Mini PC moderno básico
UD-Q2KXL 9,8 GB 16 GB Mini PC moderno básico
UD-Q4KXL / Q4KM 16–17,6 GB 32 GB Mini PC de gama media
UD-Q6_K 22 GB 32 GB (apretado) / 48 GB Configuraciones con mucha RAM
Q8_0 29 GB 48–64 GB Strix Halo, Mac con memoria unificada
BF16 54,7 GB 96 GB+ Strix Halo 128 GB, Mac Studio

Para el escalón de 32 GB, opciones como el GEEKOM A6 con Ryzen 7 6800H o el GMKtec M6 Ultra con DDR5 mueven el quant Q4, pero a un ritmo de dígito único de tok/s en CPU (no los 14 tok/s del Mac Studio). Sirve para trabajos en segundo plano; en chat interactivo se prueba la paciencia.

Si quieres velocidad real sin comprar Apple, el consenso de la comunidad apunta a Strix Halo de AMD. El proyecto strix-halo-guide midió el Q4KM oficial a 20,4 tok/s de generación y 292 tok/s de prompt en un Ryzen AI Max+ 395. El GMKtec EVO-X2 con 64 GB entra a esa plataforma por USD 1.999, y configuraciones de 128 GB como el BOSGAME M5 abren las filas Q8 y BF16 de la tabla.

Dato de mercado relevante: según el mismo artículo de Terminalbytes, un kit DDR5 SODIMM de 64 GB cuesta entre USD 750 y 870 en 2026. Comprar el mini PC con la RAM ya instalada es más barato que upgradear después, lo cual contradice veinte años de instinto comprador.

Apple vs. Strix Halo: la decisión real

Geeky Gadgets publicó una comparativa que resume bien la decisión:

  • M3 Ultra (Apple): 819 GB/s de ancho de banda real. Coste por GB: USD 41,66. Ideal para tareas intensivas en ancho de banda.
  • Strix Halo (AMD): 122 GB/s reales (256 anunciados). Coste por GB: USD 25,77. Ideal para性价比 y modelos grandes en local.
  • NVIDIA DGX Spark: 13% más rápido que Strix Halo en un modelo de 120B, pero con USD 3.000 de coste adicional y prefill 5x más rápido, clave para contexto largo.

Si tu cuello de botella es ancho de banda (inferencia de un solo modelo rápido), Apple. Si es capacidad (modelos grandes a buen precio), Strix Halo.

Cómo correrlo en 10 minutos (y el error que cuesta 20)

# descarga el Q4_K_M por defecto, 17 GB
ollama pull qwen3.8:27b

# --verbose imprime las estadísticas de tok/s
# --think=false salta el preámbulo de razonamiento
ollama run qwen3.8:27b --verbose --think=false "tu prompt"

Necesitas Ollama 0.32.12 o superior. Para llama.cpp, hay un detalle que el autor aprendió a fuerza: las builds antiguas fallan con unknown model architecture: 'qwen35'. La arquitectura híbrida requiere kernels nuevos. brew update && brew upgrade llama.cpp lo arregla. Lo mismo aplica a LM Studio, Jan y koboldcpp: si Qwen3.8 no carga, actualiza el runtime antes de debuggear nada más.

El pitch real para un founder: lo que el modelo hace todo el día

El autor lleva 10 días usando Qwen3.8 27B como asistente en segundo plano. Nada glamuroso, justo lo que importa:

  • Digest matinal de RSS: un launchd job junta los feeds no leídos durante la noche y el modelo los resume. El contexto de 262K tokens permite meter una semana entera de feeds en un solo prompt.
  • Archivo de escaneos: el correo en papel se escanea a PDF y el modelo renombra cada archivo siguiendo la convención YYYY-MM-proveedor-qué-es. La capacidad de visión maneja escaneos donde el OCR falla.
  • Resúmenes de hilos largos: un thread de 400 comentarios se pega y el modelo devuelve las posiciones atribuidas.

Ninguna de estas tareas se mide en tokens por segundo. Los requisitos son: un modelo lo bastante listo como para no archivar la carta del seguro como un menú de delivery, hardware que ya tienes y que nada salga de tu casa.

Qué significa esto para tu startup

Tres palancas concretas que puedes evaluar esta semana:

  • Audita qué vale la pena mover a local. GitHub movió Copilot a billing por uso el 1 de junio de 2026, según registró Visual Studio Magazine. Resúmenes de PR, triage de issues, renaming de archivos, clasificación de tickets y generación de tests repetitivos son candidatos naturales para correr en local y reservar tu presupuesto de Copilot para tareas agenticas complejas. Una prueba barata: mueve el resumen de RSS y la clasificación de PDFs a Qwen3.8 27B en un Mac Mini M4 y mide el ahorro mensual.
  • Decide Apple vs. Strix Halo con tus workloads reales, no con benchmarks. Si tu producto depende de inferencia de un solo modelo con latencia predecible, el ancho de banda del M3 Ultra (819 GB/s) es la diferencia entre 14 tok/s y 8 tok/s. Si tu producto encadena varios modelos en pipelines agenticos, el ecosistema y el coste por GB de Strix Halo ganan. Haz una prueba de carga con tu prompt real antes de comprar.
  • Adopta cuantización agresiva solo donde el caso de uso lo justifique. El quant de 1-bit (6,7 GB) es útil para clasificación, extracción de entidades y Q&A factual, pero no para flujos agenticos que dependen de que el modelo se comprometa con una respuesta. Reserva Q2KXL como mínimo si el modelo toma decisiones por tu producto.

Conclusión

Qwen3.8 27B no es el modelo más rápido del mercado en tok/s brutos, pero es el primero que la comunidad open-source considera confiable para dejarlo desatendido en tareas mundanas. La diferencia entre 14 tok/s y 28 tok/s desaparece cuando el modelo responde en un tercio de tokens y tu caso de uso no es chat interactivo sino automatización en segundo plano. Si tu startup ya tiene un Mac Studio, un Strix Halo o un mini PC de 32 GB, este modelo vale las dos horas que lleva configurarlo. Y si no tienes el hardware, el coste de entrada a Strix Halo (USD 1.499–1.999) se paga rápido si hoy estás pagando APIs por tareas que un cuant de 17 GB puede resolver localmente.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...