Huawei Atlas 960E: 4.096 NPU y 8 EFLOPS para IA

El anuncio que sacudió Huawei Connect 2026

El 17 de septiembre, en el Huawei Connect 2026 de Shanghái, David Wang, presidente rotativo de Huawei, presentó el Atlas 960E SuperPoD, un sistema que integra hasta 4.096 unidades de procesamiento neuronal Ascend en un único dominio de memoria. La cifra de rendimiento anunciada es de hasta 8 EFLOPS en FP8 y 16 EFLOPS en FP4, con 1 PB de memoria de alto ancho de banda (HBM) en configuración completa, según datos publicados por Huawei y recogidos por TechNode y TechGenyz.

El sistema se complementa con OceanStor M900, un clúster de almacenamiento de hasta 64 petabytes que extiende la llamada memoria de contexto (la caché KV que generan los modelos durante la inferencia) hacia unidades SSD, conectado directamente por UnifiedBus con una latencia de 60 microsegundos y 40 TB/s de ancho de banda agregado.

Por qué NPO y no más chips

La pieza menos visible —y probablemente más estratégica— del anuncio es Hi-ONE, el motor óptico basado en tecnología Near-Packaged Optics (NPO) que Huawei describe como el primero de la industria con esta arquitectura. En lugar de los aproximadamente 48.000 módulos ópticos 800G que tradicionalmente harían falta para enlazar 4.096 NPU, el Atlas 960E utiliza unos 5.500 motores Hi-ONE, cada uno con 7,2 Tbit/s de capacidad de transmisión, según TechNode.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Esa sustitución no es cosmética: Huawei afirma que reduce el consumo eléctrico en más de 550 kilovatios por SuperPoD, duplica el tiempo medio entre fallos y deja la disponibilidad del sistema en 99,8%. La compañía enmarca este avance como respuesta a un problema operativo concreto: en clusters de IA de unas 100.000 tarjetas, la comunicación entre chips puede consumir más del 40% del tiempo de entrenamiento, según datos citados por Reuters y reproducidos por TechRepublic.

De la competencia por el chip a la competencia por el sistema

El propio Wang lo explicitó durante su keynote "Advancing the Agentic World, Building a Solid Silicon Foundation": el cuello de botella ha dejado de ser el chip individual para pasar a ser el sistema que lo conecta todo. La estrategia de Huawei —que la compañía bautiza como Peerium Computing Architecture— consiste en unir cientos de miles de procesadores Ascend, y eventualmente hasta 1 millón de NPU en una configuración multi-rail, para que operen como una sola computadora gigante.

Esta es una apuesta obligada y a la vez inteligente. Obligada porque las restricciones de exportación de Estados Unidos, vigentes desde 2019, limitan el acceso de Huawei a los nodos de fabricación más avanzados. Inteligente porque convierte esa limitación en una ventaja estructural: en lugar de ganar la carrera del transistor, compite en la del throughput agregado, la eficiencia óptica y el software del stack. El roadmap anual Ascend (960DT en Q1 2027, 960PR en Q3 2027, 970 en 2028, 980 en 2029, según TechCrunch) da un horizonte de duplicación de rendimiento generación a generación.

La memoria, el verdadero cuello de botella

Wang dedicó buena parte de su presentación a un problema que muchos founders descubren cuando escalan agentes de IA en producción: la caché KV —la memoria temporal que reutiliza un modelo para no recalcular lo ya procesado— crece de forma desproporcionada con la duración y la complejidad de la tarea. Agentes que investigan durante horas, analizan documentos largos o encadenan múltiples turnos de conversación inflan esa caché hasta llevarla al límite de la HBM disponible.

La respuesta de Huawei con OceanStor M900 es tratar esa caché como una capa de almacenamiento más dentro de UnifiedBus, accesible en un solo salto desde la NPU, sin conversiones de protocolo intermedias. La compañía afirma que esta arquitectura duplica los tokens que un clúster de inferencia puede generar y reduce a la mitad el tiempo de respuesta inicial en escenarios típicos de programación con IA, según cifras recogidas en la cobertura de FayerWayer.

Dónde queda Huawei frente a Nvidia

Las cifras de rendimiento del Atlas 960E son claims del fabricante, no benchmarks independientes —algo que tanto TechGenyz como CryptoBriefing subrayan en su cobertura. Pero el contexto competitivo es revelador. Eric Xu, otro presidente rotativo de Huawei, afirmó en el mismo evento que la demanda china de chips Ascend ya supera la oferta, lo que obliga a la compañía a no-expandirse fuera de China por ahora. Más de 1.000 sistemas basados en Ascend 910C ya están desplegados, hay más de 5.200 desarrolladores activos mensualmente en el ecosistema Ascend y más de 40 modelos de IA chinos ya han sido entrenados sobre hardware Huawei, según datos reportados por CoinCentral.

La ventaja estructural de Nvidia no está en el silicio: está en CUDA, el lock-in de software que mantiene a los desarrolladores atados a su ecosistema. Ahí es donde la jugada de Huawei con CANN —su plataforma abierta para Ascend, ahora bajo un modelo comunitario— se vuelve relevante. Si CANN consigue masa crítica de developers fuera de China, la presión sobre el duopolio efectivo de Nvidia en el mercado chino se intensificará.

¿Qué significa esto para tu startup?

Si estás construyendo productos de IA, esta noticia importa más de lo que parece a primera vista. Tres lecturas prácticas:

  • El precio del cómputo y la memoria va a moverse. Cada reducción de 550 kW por clúster y cada duplicación de capacidad de tokens por inferencia empuja hacia abajo el coste por inferencia. Aunque no uses Huawei, la presión competitiva fuerza a AWS, Azure, GCP y los hyperscalers chinos a ajustar pricing en los próximos 12-18 meses. Negocia contratos plurianuales con cuidado.
  • La caché KV es tu próximo cuello de botella. Si tu agente maneja conversaciones largas, documentos extensos o cadenas de tareas, modela hoy cuánto caché consumes por sesión. El coste de memoria por usuario activo puede triplicarse al pasar de un chat corto a un agente que investiga durante una hora. Arquitectura desde el inicio con eviction policies claras.
  • Diversifica stack de cómputo cuando llegues a escala. El roadmap Ascend (960DT en Q1 2027) sugiere que, para workloads que no requieran el último 10% de optimización CUDA, van a existir alternativas reales con mejor relación precio/rendimiento en ciertos mercados. Diseña tus pipelines con una capa de abstracción (Triton, ONNX, MLX) que te permita portar entre backends sin reescribir.

El anuncio de Huawei no cambia tu roadmap de producto de la noche a la mañana, pero sí acelera una tendencia que ya estaba en marcha: la carrera de la IA dejó de ser una carrera de chips para convertirse en una carrera de sistemas. Quien entienda eso primero tendrá una ventaja de costes que, en un mercado donde el margen se comprime trimestre a trimestre, vale oro.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...