¿Qué es Qwen3.8-Flash-Next y por qué importa?
El equipo de Qwen de Alibaba presentó este 26 de agosto de 2026 un nuevo modelo de pesos abiertos llamado Qwen3.8-Flash-Next, descrito por la propia compañía como un preview de la arquitectura que dará vida a la próxima generación Qwen4.
Lo más llamativo no es solo que esté disponible abiertamente, sino el balance de eficiencia que presume: 125.000 millones de parámetros totales pero solo 6.000 millones activos por token, según la ficha técnica del modelo publicada por Alibaba y recogida por unite.ai. Esa diferencia entre tamaño total y tamaño activo es lo que en jerga se conoce como arquitectura Mixture of Experts (MoE), donde el modelo "elige" qué subredes necesita para cada token en lugar de activar todos sus parámetros.
En paralelo, Alibaba lanzó comercialmente Qwen3.8-Flash (la versión "producción" del mismo diseño), disponible vía Qwen Cloud con API a 1 yuan (≈US$0,15) por millón de tokens de entrada y 3 yuanes (≈US$0,45) por millón de tokens de salida, según Reuters. La compañía asegura que entrenar este modelo costó alrededor de una novena parte de lo que costó entrenar su Qwen3.7-Plus anterior.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadPara un founder hispanohablante que está eligiendo con qué modelo construir su próximo producto, esa combinación — pesos abiertos, contexto largo y coste de entrenamiento radicalmente menor — es exactamente lo que vuelve a Qwen un actor clave para 2026.
Las cuatro decisiones de diseño que cambian el juego
Según el análisis técnico publicado por unite.ai sobre la tarjeta del modelo, el equipo de Qwen describe cuatro cambios centrales que distinguen a Qwen3.8-Flash-Next de sus iteraciones previas:
- Atención híbrida rediseñada: modelos anteriores de Qwen combinaban Gated DeltaNet con Gated Attention; ahora la atención secundaria se reemplaza por Qwen Sparse Attention (QSA), que opera a nivel de micro-bloques en lugar de token por token. El equipo afirma que esto recorta significativamente la latencia en contextos largos.
- Residuales con compuertas: se introduce un mecanismo de gated residual que modula el flujo de información con una compuerta de lectura (por elemento y dependiente de los datos) y una compuerta de escritura escalar por rama. La promesa: más expresividad por capa sin sacrificar estabilidad de entrenamiento ni disparar el coste de inferencia.
- Capa de n-gram embeddings: en lugar de seguir inflando el número de expertos, el modelo añade 51.000 millones de parámetros en un embedding aparte indexado por bigramas y trigramas en la capa 2. Esta vía permite escalar parámetros gastando menos cómputo que en un MoE puro y, según Qwen, es más fácil de descargar a aceleradores con memoria limitada. Se suma una capa de multi-token prediction de unos 4.000 millones de parámetros.
- Receta de entrenamiento sin warmup tradicional: se combinan los optimizadores Muon y AdamW aplicados a categorías de pesos específicas, y se elimina el warmup clásico de tamaño de batch para arrancar directamente al batch objetivo, apoyándose en leyes de escala re-ajustadas. El resultado, según el equipo, son menos pasos totales de optimizador y la posibilidad de usar learning rates más agresivos.
Benchmarks reportados por el propio vendor (con asteriscos)
La tarjeta compara Qwen3.8-Flash-Next con Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 y Claude-Opus-4.6 (Max), siempre usando los harnesses internos del equipo Qwen. Cifras destacadas:
- DeepSWE 1.1 (coding agentico): 58,7 vs 42,2 de Qwen3.8-27B y 54,4 de DeepSeek-V4-Flash. La propia tarjeta aclara que DeepSWE se corrió con dos harnesses (Claude Code y mini-SWE-agent) y se reportó el mejor puntaje.
- SWE-bench Pro: 62,5 vs 61,7 de Qwen3.8-27B y 55,8 de Qwen3.7-Plus, tras una "refined version" del benchmark donde el equipo corrigió lo que considera tareas problemáticas.
- GPQA Diamond: 91,7.
- LiveCodeBench v6: 91,9.
- HLE: 35,9, pero juzgado por GPT-4o en lugar del grader por defecto del benchmark.
El matiz importante: son cifras autoreportadas por Alibaba, en sus propios entornos de evaluación. unite.ai lo señala con claridad: "These are vendor-reported figures, evaluated on the team's own harnesses, and they should be read as such." Para una decisión seria de adopción conviene esperar tests independientes.
Disponibilidad, licencia y hardware recomendado
Qwen3.8-Flash-Next está disponible en Hugging Face bajo la licencia qwen-community-1.0, con pesos en BF16 que suman aproximadamente 180.000 millones de parámetros entre el modelo de lenguaje, la capa de n-gram embeddings y la capa de multi-token prediction.
La tarjeta recomienda desplegarlo con SGLang, vLLM o TokenSpeed. El propio Simon Willison — autor del post original que motiva este artículo — lo probó en una NVIDIA DGX Spark usando los cuantizados de Unsloth y reportó haber cargado las variantes UD-IQ1S (72,5 GB) y UD-Q2K_XL (78,9 GB), aunque aclara que todavía está explorando el modelo. Para una startup, eso significa que el modelo cabe en workstations de gama alta con cuantización agresiva, sin necesidad de un cluster de GPU empresarial.
La versión "producción" pensada para integrar vía API es Qwen3.8-Flash, no la Next. La diferencia: Qwen3.8-Flash trae un contexto por defecto de 1 millón de tokens, herramientas oficiales integradas y se comercializa a través de Qwen Cloud, mientras que Flash-Next es el preview experimental.
Qué significa esto para tu startup
- El coste por token sigue cayendo en frontera abierta. Qwen3.8-Flash-Next entrenó con alrededor del 11% del coste de Qwen3.7-Plus según Alibaba (recogido por Reuters y blockonomi.com). Aunque esa cifra se refiere a entrenamiento y no a inferencia, marca la dirección del mercado: cada nueva generación abierta gasta menos para alcanzar (o superar) el rendimiento de la anterior.
- Los contextos de 1 millón de tokens ya son producto, no demo. Tanto la versión API como el preview experimental apuntan a 262K tokens nativos ampliables a 1M, suficientes para análisis de documentos extensos, due diligence legal, ingestion de codebases grandes y agentes de investigación con varias horas de conversación.
- El ecosistema chino se consolida como alternativa real al duopolio OpenAI/Anthropic. El propio post de Willison se titula "Another open weights model from Qwen" — la palabra "another" ya no sorprende. Para founders en LATAM y España, esto abre margen real de negociación con proveedores cloud y reduce el riesgo de quedar atrapado en un único vendor.
Acciones concretas que podés tomar esta semana
- Probar el modelo localmente antes de comprometerte con la API. Bajá los cuantizados de Unsloth para Qwen3.8-Flash-Next desde Hugging Face y validá calidad de salida y latencia en tu caso de uso concreto. Si un quant de ~78 GB ya corre en workstations como la DGX Spark, podés hacer un proof of concept sin gastar créditos de nube.
- Comparar coste total, no solo el price per token. Alibaba lista US$0,16 / millón de input y US$0,47 / millón de output para Qwen3.8-Flash en mercados internacionales (Reuters). Contrastalo con los precios vigentes de OpenAI, Anthropic y Google para tu volumen real, sumando cached tokens, reasoning tokens y posibles descuentos enterprise antes de migrar cargas.
- Diseñar tu arquitectura para poder cambiar de modelo en meses, no en años. Que Qwen3.8-Flash-Next sea un "preview de Qwen4" implica que en pocos meses veremos una versión flagship más capaz. Mantené tus prompts, evals y pipelines de datos desacoplados del modelo concreto: la capa de abstracción que escribas hoy la vas a amortizar en cuanto llegue Qwen4.
Fuentes
- Qwen3.8-Flash-Next — Simon Willison (fuente original)
- Qwen3.8-Flash-Next Previews Qwen4 Architecture With Hybrid Attention and 6B Active Parameters — unite.ai
- Alibaba's Qwen launches Qwen3.8-Flash AI model with lower training costs — Reuters (vía Yahoo News)
- Alibaba (BABA) Stock: Qwen Slashes AI Training Costs by 89% with New Qwen3.8-Flash Model — blockonomi.com
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













