Tencent Hy4 Preview: qué hay detrás del salto de 295B a 770B parámetros
Tencent presentó Hy4 Preview, un nuevo modelo de lenguaje open-weight de entrada solo texto (sin visión) publicado por el equipo Hunyuan de la compañía china. El modelo suma 770.000 millones de parámetros totales con 49.000 millones activos por token, una ventana de contexto de 1 millón de tokens y un peso total de 1,56 TB en Hugging Face, según reportó Simon Willison este 29 de agosto.
Lo que más llama la atención no es solo el tamaño: Hy4 da el salto cuantitativo más agresivo del ecosistema open-weight chino en lo que va de 2026. Frente a Hy3 (la generación previa, liberada el 6 de julio de 2026), multiplica por 2,6 los parámetros totales, por 2,3 los activos por token y por casi 4 la ventana de contexto, que pasa de 256K a 1M de tokens. Es la confirmación de que Tencent ya no compite solo por eficiencia, sino que vuelve a jugar la carta del tamaño.
Qué trae Hy4 que Hy3 no tenía
Hy4 usa una arquitectura Mixture-of-Experts (MoE) con 78 capas, 256 expertos enrutados más uno compartido, según el resumen publicado por TechGenyz. En MoE, solo una fracción de los parámetros se activa por token: por eso el coste de inferencia escala con los 49B activos, no con los 770B totales.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadEl detalle más interesante para ingeniería es el sistema de razonamiento. El chat_template.jinja publicado en Hugging Face muestra que Hy4 ofrece solo dos niveles de razonamiento: high (por defecto) y no_think (desactiva la cadena de pensamiento). Esto contrasta con Hy3, que admitía tres modos (no_think, low y high). Para equipos que ajustan costes por tarea, Hy4 simplifica el routing: o razonas en profundidad, o respondes rápido, sin término medio.
Willison probó el prompt clásico del "pelícano en bicicleta" con razonamiento high vía OpenRouter y el modelo produjo un SVG correcto, con trazas de razonamiento en inglés ligeramente truncado (presumiblemente para ahorrar tokens).
Por qué importa este movimiento a Tencent
La hoja de ruta reciente cuenta una historia clara. Hy3 llegó el 6 de julio de 2026 bajo licencia Apache 2.0, con 295B totales y 21B activos, y registró 68 veces más llamadas API que su predecesor, además de liderar el ranking global de OpenRouter en su primera semana, según el comunicado oficial recogido por Yahoo Finance. Forbes destacó que Tencent posicionó Hy3 deliberadamente como un modelo optimizado para agentes y flujos de trabajo empresariales, no para ganar benchmarks.
Apenas 54 días después, Hy4 dobla casi todo. Esto sugiere dos cosas:
- Tencent ya tiene el músculo de cómputo para escalar parámetros sin esperar al próximo ciclo de chips. La propia compañía asegura que Hy4 se usó en la optimización de su pipeline de inferencia, reportando un aumento de 31,8% en throughput end-to-end respecto a su configuración previa.
- La presión competitiva es real. El rival chino Zhipu AI liberó GLM-5.2 con 744B totales y ~40B activos, superando a Hy3 en casi todos los benchmarks de código (SWE-bench Verified 84,2 vs 78,0, Terminal-Bench 2.1 81 vs 71,7, DeepSWE 46,2 vs 28,0), según datos del propio apéndice de benchmarks de Tencent analizados por TechTimes y VentureBeat. Hy4 parece diseñado para responder a esa presión sin perder el sello de eficiencia MoE.
Cuánto cuesta probarlo y dónde está disponible
Hy4 Preview está disponible como pesos abiertos en Hugging Face (tencent/Hy4-preview) y como endpoint en OpenRouter (tencent/hy4-preview). La nota de TechGenyz no publicó precios oficiales en el momento del lanzamiento, pero el precedente inmediato es útil: Hy3 se ofreció gratis en WorkBuddy hasta el 31 de agosto de 2026 y reportó tarifas de US$0,14 por millón de tokens de entrada y US$0,58 por millón de salida en OpenRouter tras la ventana gratuita. Si Tencent mantiene la política de Hy3 con Hy4, espera una ventana de evaluación gratuita corta (entre 10 y 14 días) antes de pasar a cobro.
El coste de autohospedaje es la otra variable crítica. Hy3 requería 8 GPUs H20 (la variante NVIDIA permitida para China) con 598 GB en BF16 o 300 GB en FP8. Hy4 pesa 1,56 TB; ejecutarlo en local demandará un clúster mayor y memorias HBM de alta capacidad, lo que en la práctica deja a la mayoría de las startups fuera del self-hosting y las empuja a la API.
Consideraciones legales antes de elegir Tencent
Si tu startup maneja datos sensibles, propiedad intelectual o información regulada, hay un punto no negociable. TechTimes documenta que las llamadas a la API de Tencent Cloud (TokenHub) están sujetas a la Ley de Inteligencia Nacional china (2017, enmendada en 2018) y a la Ley de Ciberseguridad china, que desde el 1 de enero de 2026 cubre explícitamente sistemas de IA. Eso significa que los datos que transitan por la infraestructura de Tencent pueden ser solicitados por autoridades chinas, independientemente de la política de privacidad de la compañía.
Buena noticia para casos de uso menos sensibles: los pesos Apache 2.0 se pueden descargar y desplegar en infraestructura propia fuera de China. Si autohospedas Hy4 (con el coste que eso implica), eliminas la exposición al tráfico de datos vía Tencent, pero asumes el peso en GPU.
El Departamento de Defensa de EE.UU. incluyó a Tencent en su lista de empresas con vínculos militares en enero de 2025 bajo la Sección 1260H, y la prohibición de contratar con ellas entró en vigor en junio de 2026. Tencent impugnó la designación y el resultado no se ha resuelto. Para una startup con clientes del sector público estadounidense o proyectos regulados, este es un dato relevante para la conversación con legal.
Qué significa esto para tu startup
1. La barrera de entrada al estado del arte cayó otra vez. Hace seis meses, un modelo open-weight con contexto de 1M de tokens era propietario. Hoy lo puedes descargar gratis. Si tu producto depende de analizar documentos largos, códigobases grandes o historiales de soporte extensos, Hy4 vale una prueba esta misma semana, antes de que termine cualquier ventana gratuita inicial.
2. El coste marginal por token sigue bajando. El combo MoE + razonamiento opcional + ventana de 1M permite construir agentes que razonan solo cuando lo necesitan. Rutea tareas de parsing y formateo a no_think y reserva high para planificación. Esa disciplina puede reducir tu factura de inferencia entre 40% y 60% frente a un modelo denso equivalente.
3. Diversifica tu stack de modelos. Ningún proveedor abierto chino o estadounidense va a cubrir todos tus casos. Una arquitectura sana hoy mezcla al menos dos modelos: uno propietario para los flujos críticos con SLA, y uno open-weight como Hy4 o GLM-5.2 para experimentación, fallback y cargas menos sensibles.
Acciones concretas esta semana:
- Evalúa Hy4 en OpenRouter sobre tres tareas reales de tu producto (extracción de un documento largo, agente de código, búsqueda agéntica). Mide coste, latencia y calidad frente a tu modelo actual.
- Audita qué datos pueden pasar por la API china. Si tienes código propietario o datos de clientes europeos, autohospedar o elegir otra opción pesa más que el ahorro.
- Diseña tu pipeline con
no_thinkpor defecto y activahighsolo cuando el caso de uso lo justifique. El template oficial lo permite explícitamente.
Fuentes
- Introducing Hy4 Preview (Simon Willison)
- Hy4 preview: 770B Remarkable Open Model Launch (TechGenyz)
- Tencent's Hy3 Bets On AI Agents Over Model Size (Forbes)
- Tencent Open-Sources Hy3 Agent Model: How MoE Routing Cuts Costs, and What China Law Adds Back (TechTimes)
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













