Z.ai lanza GLM-5.3-Flash: 18B activos, 1/10 del precio

Z.ai publica GLM-5.3-Flash: el primer multimodal nativo de la serie GLM-5

Z.ai, el primer fabricante de LLMs en salir a bolsa en el mundo (Hong Kong, enero de 2026), liberó el 26 de agosto de 2026 GLM-5.3-Flash, su nuevo modelo multimodal nativo con 320.000 millones de parámetros totales y solo 18.000 millones activos. La compañía asegura que supera a GLM-5.2 en todos los benchmarks de programación y agentic, se acerca a Claude Opus 4.8 en coding y agentic, y lo hace a una décima parte del precio por tarea. Los pesos están disponibles en HuggingFace bajo licencia permisiva, y el modelo ya se ofrece a todos los usuarios del plan GLM Coding con 3x la cuota usable de GLM-5.3.

La métrica que más importa para un founder es la eficiencia. En el Artificial Analysis Intelligence Index v4.1.1, GLM-5.3-Flash alcanza un puntaje de 57 a US$0,045 por tarea (con descuento). "Un nivel de inteligencia que antes solo estaba disponible a un costo aproximadamente 10 veces superior", según el blog oficial de Z.ai. En la semana previa al anuncio, Z.ai lo probó de incógnito como ox-alpha en OpenCode y OpenRouter, donde se convirtió en el modelo más usado de la semana. Todo el tráfico se sirvió sobre chips chinos.

Arquitectura híbrida: sparse + linear attention para bajar el costo de contexto largo

GLM-5.3-Flash introduce por primera vez una arquitectura que combina atención lineal y sparse (atendedores híbridos). La atención lineal captura dependencias locales mediante state modeling, mientras que la sparse recupera contexto global relevante con un indexador ligero. Para reducir la latencia y el consumo de memoria del indexador en ventanas de 1 millón de tokens, Z.ai introduce IndexPool, que comprime cuatro vectores clave del indexador en uno solo mediante weighted pooling.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Las cifras concretas de la publicación:

  • Parámetros totales: 320B (vs 355B en GLM-4.5)
  • Parámetros activados: 18B (vs 32B en GLM-4.5)
  • Capas: 45 (vs 92 en GLM-4.5)
  • Compute de atención reducido: 3,0x frente a GLM-5.3
  • Tamaño de KV cache reducido: 4,4x frente a GLM-5.3
  • Manifold-Constrained Hyper-Connections (mHC): mejora eficiencia de escalado
  • Corpus de preentrenamiento multimodal: 30 billones de tokens

Z.ai aclara que la KV cache todavía es ligeramente mayor que la de Kimi-K3 y DeepSeek-V4-Flash, los dos modelos abiertos con los que se compara, dejando espacio para mejoras. Aún así, GLM-5.3-Flash tiene el menor compute de atención entre los modelos comparados.

Resultados en benchmarks: supera a GLM-5.2 por márgenes amplios

Los números más relevantes del anuncio oficial sobre coding y agentic:

Benchmark GLM-5.3-Flash GLM-5.2 Opus 4.8 Gemini 3.7 Flash
DeepSWE v1.1 63,4 46,2 58,0 65,3
AutomationBench 48,8 26,2 41,0 52,3
Toolathlon Verified 78,4 59,9 76,2
Terminal Bench 2.1 84,3 81,0 85,0 85,8
NL2Repo 56,3 48,9 69,7

En el benchmark interno Z.ai Code Bench v1.0 (corrido sobre Claude Code 2.1.207), GLM-5.3-Flash supera a GLM-5.2 en todos los niveles de esfuerzo y casi iguala a Opus 4.8 al máximo esfuerzo (29,0 vs 29,5).

En visión, destaca OfficeQA Pro con 62,4 (vs 48,9 de Opus 4.8) y Chartography w/ Tools con 78,0 (vs 75,0). En el resto de pruebas visuales queda por debajo de Gemini 3.7 Flash en video, pero compite en documentos y gráficos.

Sirviendo un modelo frontier en chips chinos a escala de decenas de miles de aceleradores

La pieza más estratégica del anuncio es la de infraestructura. Z.ai describe haber servido GLM-5.3-Flash en un cluster a gran escala de chips de IA chinos con un motor de inferencia propio sobre SGLang, optimizado para hardware nacional. El trabajo se aceleró, según la compañía, gracias a un agente de infraestructura potenciado por GLM-5.3, que ayudó a escribir kernels, diagnosticar cuellos de botella y mejorar el stack. Un loop en el que el modelo optimiza el sistema que lo sirve a sí mismo.

El stack combina paralelismo tensorial intra-nodo para Linear Attention y la cabeza LM, ReplaySSM, cuantización W8A8, cuantización de cache híbrida INT8/FP8/BF16 y Layer Split. A escala de cluster, Z.ai usa una arquitectura Encode-Prefill-Decode (EPD) desagregada, que separa encoding multimodal, prefill del prompt y decoding token a token en pools de workers escalables independientemente.

La cifra más relevante: 3x de mejora en rendimiento end-to-end frente a su línea base inicial sobre el mismo hardware, alcanzando una eficiencia y costo por token comparables a GPUs NVIDIA mainstream. La IBTimes ya había adelantado en julio que Z.ai completó un datacenter con al menos 10.000 chips de fabricación china para entrenar y servir sus sistemas GLM. El contexto importa: según CNBC, un funcionario de la Casa Blanca acusó a Moonshot AI de acceder a chips Nvidia GB300 pese a las restricciones de exportación, y el Tesoro estadounidense amenazó con sanciones a empresas chinas que realicen ataques de destilación sobre modelos de frontera.

El contexto competitivo: la presión de los modelos chinos abiertos

GLM-5.3-Flash llega en plena efervescencia del ecosistema abierto chino. Según MarketWatch, Kimi K3 de Moonshot AI se ofrece a US$15 por millón de tokens de salida, frente a los US$30 de GPT-5.6 Sol y los US$50 de Claude Fable 5. La presión de precios llevó a DeepSeek a anunciar una subida de hasta 4x en sus modelos V4 Flash y Pro, aunque el precio blended de V4 Pro sigue por debajo del de GLM-5.2, según Artificial Analysis.

Z.ai no es un recién llegado. Salió a bolsa en Hong Kong el 8 de enero de 2026 bajo el código 2513, con una valoración post-money superior a HK$51.000 millones (ChinaBizInsider). Atiende a más de 12.000 clientes enterprise y 45 millones de desarrolladores globalmente, con un ARR de US$1.000 millones en julio según IBTimes, y ha dedicado el 70% de los fondos del IPO a I+D en modelos foundation.

Qué significa esto para tu startup

GLM-5.3-Flash encaja en un patrón que 2026 ha confirmado: la inteligencia frontier ya no exige pagar precios frontier. Si tu equipo está gastando más de US$10.000/mes en APIs de modelos cerrados para tareas de coding, generación visual o agentic de complejidad media, este lanzamiento es una señal directa de que el costo por tarea puede caer entre 5x y 10x sin sacrificar rendimiento.

Tres palancas concretas que un founder puede mover esta semana:

  1. Probar GLM-5.3-Flash en flujos de coding agentic no críticos. El plan GLM Coding ofrece 3x la cuota de GLM-5.3, accesible desde z.ai/subscribe. Úsalo primero en refactors, generación de tests y migración de código legacy donde puedes tolerar errores. Mide tokens consumidos por tarea y compara contra tu proveedor actual. En Z.ai Code Bench v1.0 al máximo esfuerzo, casi iguala a Opus 4.8 (29,0 vs 29,5), así que el techo de calidad para tareas de coding de complejidad media es competitivo.

  2. Evaluar self-hosting con pesos abiertos si tienes carga de inferencia alta. Los pesos están en HuggingFace y soportan SGLang, vLLM y TokenSpeed. Para una startup que procesa más de 500 millones de tokens al mes, el costo de montar un cluster en GPUs usadas o en hardware alternativo puede ser inferior al de la API en menos de un trimestre. La reducción de 4,4x en KV cache frente a GLM-5.3 hace viable correr contextos largos en hardware modesto.

  3. Explorar capacidades multimodales para frontend y QA visual. El modelo soporta Browser Use y Computer Use dentro de ZCode (zcode.z.ai), con verificación visual de páginas web y operación de aplicaciones de escritorio. Para founders que construyen productos con UI compleja, esto habilita flujos agentic que antes requerían varios modelos separados.

Antes de migrar, verifica tres cosas: la licencia permite tu caso de uso comercial, la latencia de inferencia en tu región (Z.ai sirve principalmente desde China, según el anuncio), y si necesitas benchmarks propios en tu dominio — los números oficiales son de Z.ai y, como señaló IBTimes, enfrentarán escrutinio cuando desarrolladores independientes los prueben en producción.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...