GLM-5.3 de Z.ai supera a OpenAI y Anthropic por 1/5 del coste

Un open-weight chino que limpia el tablero en pruebas reales

GLM-5.3, el nuevo modelo de código abierto del laboratorio chino Z.ai (antes Zhipu AI), se convirtió en la primera referencia que aprueba las cinco esquinas del test Ed-o-meter: codificación, datos, casos del mundo real, seguridad y uso de herramientas. Lo logra con un 100% de aciertos en cada categoría, un puntaje de 9.3/10 en la rúbrica cualitativa y un coste total de US$0,28 por la vuelta completa —aproximadamente una quinta parte del gasto del modelo que lideraba antes el ranking. La cifra, junto al detalle de las 28 tareas, aparece en el leaderboard publicado por la organización independiente Reinvently.

El dato importa porque el harness, llamado Featherbench, está pensado para imitar trabajo real de desarrollador: depurar bugs, escribir scripts, leer contratos de alquiler, rechazar jailbreaks o planificar unas vacaciones en Lisboa, entre otros. No son tests académicos de MMLU o SWE-bench. Según Reinvently, ejecutar las 28 tareas con cualquier modelo cuesta unos US$30 en total —suficientemente barato para que un equipo pequeño pueda reproducir el resultado por su cuenta.

Qué dice exactamente el leaderboard de Reinvently

El Ed-o-meter compara 13 modelos por cinco categorías y publica los resultados en abierto, junto al código del harness en GitHub bajo licencia MIT. Lo más relevante del reporte, fechado el 23 de agosto de 2026:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • GLM-5.3 lidera con 100% en las cinco esquinas, rúbrica de 9.3 y US$0,28 por vuelta completa. La pega: una latencia mediana de 16,3 segundos hasta el primer token.
  • GPT-5.5 es la alternativa más rápida (13,2 s) con el mismo 100% en seguridad, pero solo 89% en casos reales y un coste de US$1,43.
  • Kimi-K3 marca la rúbrica más alta (9,5) y un 96% de aciertos, pero tarda 26,4 s en empezar a responder —el segundo peor tiempo del tablero. La nota práctica del benchmark lo descarta para uso interactivo.
  • Fable-5 y Opus-5 empatan en el último puesto (79%) por una razón que no es calidad: rechazaron tareas de debugging benignas antes de emitir un solo token. Para el usuario final, un rechazo y un fallo se ven iguales, y el harness los cuenta igual.
  • GPT-5.6 Luna, Terra y Sol pasaron solo 3 de 12 celdas de jailbreak: el canario saltó en el 33–50% de las pruebas. El reporte recomienda no usarlos sin guardarraíles propios.

El propio leaderboard aclara varios matices: la rúbrica de 9.3 de GLM-5.3 fue asignada por el juez Fable-5 con un sesgo documentado, y un checker de recetas vegetarianas marcó falsos positivos que ya fueron corregidos sin alterar las pruebas. La transparencia —publicar las notas, los rechazos, los costes reales y los intervalos de confianza— es el punto que el autor, Ed Yau, defiende como respuesta al "benchmark maxing" de los grandes labs.

Lo que ya se sabía sobre GLM-5.3

Z.ai presentó GLM-5.3 el 14 de agosto de 2026 como una iteración de post-entrenamiento sobre la base de GLM-5.2 (753 mil millones de parámetros, ventana de un millón de tokens). No se reentrenó el modelo base: se hicieron más entornos sintéticos, más diversidad de tareas y más cómputo. El resultado, según la propia empresa:

  • 743 mil millones de parámetros y menor consumo de tokens por tarea que su antecesor.
  • 84,5% en CyberGym, superando al modelo Anthropic Mythos 5 (83,8%) y a GPT-5.6 Sol (83,6%), según reportó Developer Tech.
  • 28,3 en Terminal Bench 3.0 (autonomía en terminal real), por detrás de modelos cerrados como Fable 5 (33,7) y GPT-5.6 Sol (34,6), pero el más alto entre modelos de pesos abiertos.
  • 66,9 en DeepSWE v1.1 (resolución de issues reales de GitHub), por debajo de Kimi-K3 (67,5) y Fable 5 (69,7).
  • Un Security Disclosure Ledger con 2.436 vulnerabilidades detectadas en 269 proyectos open source, 1.097 de severidad media-alta.

Sobre precio, Decrypt recordó que la API de Z.ai ronda la décima parte de los precios frontera de EEUU: GLM-5.2 estaba en US$1,40 de entrada y US$4,40 de salida por millón de tokens, frente a GPT-5.3-Codex (US$1,75 / US$14) o Claude Opus 4.8 en el techo de Anthropic. GLM-5.3 mantiene ese plan de suscripción con cuotas por puntos y promete liberar los pesos en Hugging Face tras dos semanas de evaluación de seguridad. El laboratorio está en la Entity List de Estados Unidos, lo que impide a empresas estadounidenses exportarles tecnología controlada —un detalle relevante para founders que contratan vía APIs en la nube.

¿Qué significa esto para tu startup?

El titular "open-weight gana a Anthropic y OpenAI" debe leerse con tres lentes, porque cada uno cambia la decisión:

  1. Coste por tarea, no solo por token. GLM-5.3 resolvió las 28 pruebas por US$0,28; GPT-5.5 por US$1,43. Si tu agente corre miles de tareas al día, el modelo abierto te cambia la economía de la unidad, no la del proveedor. Antes de optimizar, mide coste por tarea completada (no por token) en tu flujo real.
  2. Latencia mata la interactividad. GLM-5.3 tarda 16,3 s hasta el primer token. Para un chatbot de atención al cliente es inutilizable; para un agente batch que genera informes nocturnos, es perfecto. Mapea qué flujos toleran esa espera y cuáles no, y elige el modelo en función del flujo, no del proveedor.
  3. El guardarraíl del proveedor no es tu guardarraíl. Tanto Opus-5 como Fable-5 bloquearon tareas de debug inofensivas, y los GPT-5.6 fallaron 11 de 12 pruebas de jailbreak. Si dejas la seguridad al modelo, vas a fallar en producción. Diseña una capa externa de validación, sobre todo si sirves a clientes enterprise.

Acciones concretas esta semana

  • Replica el benchmark con tus propios casos. Featherbench es MIT y las tareas están en JSON. Sustituye las 28 tareas por 10–15 flujos reales de tu producto (extracción de facturas, clasificación de tickets, generación de SQL) y compara GLM-5.3, GPT-5.5 y Claude Opus con la misma métrica: coste por tarea resuelta, latencia p50 y tasa de rechazo. La inversión ronda los US$30–50.
  • Monta un enrutador por flujo. Si trabajas con OpenRouter o con un proxy equivalente, configura rutas separadas: un modelo rápido y barato (tipo GPT-5.6 Luna o Haiku 4-5) para clasificación y tareas reversibles, y un modelo pesado (GLM-5.3, GPT-5.5 o Kimi-K3) para generación crítica. El leaderboard muestra que ningún modelo único domina en coste, calidad y latencia a la vez.
  • Evalúa el riesgo regulatorio antes de self-host. Si tu startup tiene clientes en EE.UU. o maneja datos cubiertos por HIPAA/SOC2, confirma con legal el uso de un modelo de Z.ai, dado que la compañía está en la Entity List. Para mercados latinoamericanos y europeos sin exposición federal estadounidense, el coste-beneficio suele ser más claro.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...