Alibaba lleva Qwen hasta los 10 billones de parámetros

¿Qué acaba de anunciar Alibaba y por qué importa?

Alibaba confirmó el 22 de septiembre, en su conferencia anual Apsara, que Qwen 4 está en entrenamiento y que su hoja de ruta para Qwen 4.5 y Qwen 5 apunta a modelos de entre 5 y 10 billones de parámetros. La cifra más que duplica el tamaño de Qwen3.8-Max, que ya cuenta con 2,4 billones, según reportó TechRepublic.

Para dimensionar el salto: hace dos años DeepSeek-V3 presentó 671.000 millones de parámetros; Moonshot AI llevó Kimi K2 hasta el billón; y ahora Kimi K3 alcanza los 2,8 billones en una arquitectura open-weight, según Unite.AI. Pasar de ahí al rango de los 10 billones ya no es una especulación: es un objetivo explícito de calendario en la hoja de ruta pública de Alibaba.

¿Por qué China ya no juega solo en el extremo pequeño?

La narrativa clásica separaba al ecosistema chino en dos carriles: modelos compactos y eficientes (Qwen, MiniCPM) frente a gigantes cerrados de EE. UU. Esa frontera se está borrando. Alibaba, responsable de una de las familias más usadas en despliegues pequeños, es ahora la compañía que ha colocado la frontera de los 10 billones en su roadmap público, según Malay Mail.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

No es la única. Moonshot AI liberó Kimi K3 el 16 de julio de 2026 como modelo open-weight con 2,8 billones de parámetros y se convirtió en el primer modelo chino en liderar el leaderboard Arena.ai Frontend Code Arena, de acuerdo con The Motley Fool. DeepSeek escaló a V4 Pro con 1,6 billones totales (49.000 millones activos) y el 10 de septiembre lanzó V4.1-Flash, cuya arquitectura Causal Encoder-Decoder reduce el consumo de memoria un 75% frente a la generación anterior, según TechRepublic. ByteDance persigue una escala similar, según Financial Times, aunque sin confirmación oficial.

¿Qué significa realmente "X billones de parámetros"?

Conviene desmontar una confusión habitual: el número total no equivale a la capacidad activa en cada inferencia. La mayoría de estos modelos usan arquitecturas Mixture of Experts (MoE): dividen los parámetros en especialistas y solo activan una fracción por token. Qwen3.8-Max reúne 2,4 billones totales pero activa cerca de 95.000 millones por paso. Kimi K3 tiene 896 expertos y solo activa 16, según Unite.AI. DeepSeek V4.1-Flash maneja 552.000 millones totales con 8.000 millones activos en prefill y 16.000 millones en decode.

La consecuencia práctica para founders: el coste de inferencia depende de los parámetros activos, no del total. Por eso DeepSeek V4 Flash puede cobrar USD 0,14 por millón de tokens de entrada, undercutiendo a GPT-5.4 Nano, Gemini 3.1 Flash y Claude Haiku 4.5, según TechCrunch.

¿Más grande significa mejor? No automáticamente

La historia del sector recuerda por qué. En 2022, DeepMind demostró con Chinchilla que un modelo de 70.000 millones entrenado con aproximadamente cuatro veces más datos superaba a Gopher, de 280.000 millones, en casi todas las tareas evaluadas. Tamaño importa, pero arquitectura, datos y presupuesto de cómputo pesan tanto o más.

La propia Alibaba aporta evidencia reciente. Su Qwen3.8-Max pasó de un puntaje Artificial Analysis de 40 a 45 tras 33 ciclos iterativos de auto-mejora, y en un experimento de diseño de chips completó más de 60 horas de iteración autónoma que redujeron el área del silicio un 42% sin comprometer rendimiento, según Malay Mail. El tamaño habilita casos; el dato fino y el cómputo los capitalizan.

¿Qué significa esto para tu startup?

Tres implicaciones concretas si estás construyendo producto con IA en 2026:

  • Presupuestos de inferencia a la baja, con letra pequeña. Anthropic lanzó Claude Opus 5.5 el 22 de septiembre con un coste de ejecución un 40% inferior al de la generación anterior, según Reuters. DeepSeek V4.1-Flash recorta un 77-80% el coste frente a V4 Pro, según Yahoo Finance. OpenRouter ya registra que el volumen de tokens de modelos chinos pasó de cerca del 30% a aproximadamente el 60% del total en meses recientes, mientras los modelos premium de EE. UU. siguen capturando la mayor parte del gasto, de acuerdo con The Motley Fool. Para una startup esto habilita agentes de larga duración y ventanas grandes de contexto que hace un año eran prohibitivas, pero la comparativa cambia cada trimestre: conviene fijar contratos cortos y medir coste por tarea, no por token.

  • Acceso a modelos frontier sin pagar frontier. Kimi K3 ya está disponible en Amazon Bedrock desde el 18 de septiembre, según Unite.AI, y los pesos del modelo son open-weight y descargables desde Hugging Face. Esto cambia el cálculo para founders que necesitan control sobre datos, inferencia on-premise o personalización profunda. Antes esa flexibilidad implicaba renunciar a calidad de frontera; ahora compite en coding benchmarks con modelos cerrados.

  • El stack completo redefine la presión competitiva. Alibaba no se limitó a anunciar modelos más grandes: presentó el chip Zhenwu V900 (216 GB de memoria, 1.200 GB/s de ancho de banda inter-chip, soporte nativo FP8 y FP4, producción prevista para Q1 2027), un cluster escalable a 500.000 tarjetas aceleradoras y una capa de agentic cloud que reduce costes de almacenamiento un 69% y uso de tokens un 67%, según TechRepublic y Malay Mail. Eddie Wu, CEO de Alibaba, dijo que el objetivo es superar los 20 GW de capacidad de centros de datos operada por Alibaba Cloud en 2032. Para una startup esto importa porque quien controla chip + modelo + nube puede ofrecer precios agresivos sin sacrificar margen, y esa presión ya está llegando a los incumbentes estadounidenses.

Acción concreta: audita tu coste mensual por millón de tokens en tu proveedor actual y compara con V4 Flash, Kimi K3 y Claude Opus 5.5. Si tu volumen supera los 100 millones de tokens al mes, una migración parcial puede amortizarse en un trimestre.

Acción concreta: si dependes de un único proveedor de inferencia, experimenta con un segundo (Bedrock + open-weight) durante un sprint de dos semanas. La volatilidad del mercado de modelos es ahora estructural.

Conclusión

La carrera china de la IA ya no se libra solo en el extremo pequeño del espectro. Alibaba, Moonshot, DeepSeek y ByteDance han colocado la frontera de los 10 billones de parámetros en sus hojas de ruta públicas, apoyándose en arquitecturas MoE que mantienen controlados los costes de inferencia activa. Para un founder, la consecuencia operativa inmediata es una presión sostenida a la baja sobre el coste por token y una apertura real a modelos frontier open-weight, un cambio que hace 12 meses parecía reservado a los hyperscalers.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...