Huawei adelanta tres trimestres su NPU Ascend 960DT y escala a 4.096 chips por dominio
La compañía china presenta en Connect los aceleradores Ascend 960DT y 960PR, con hasta 4 petaFLOPS en FP4, memoria propia y una red óptica que agrupa miles de chips.
Huawei ha presentado en su conferencia anual Connect la familia Ascend 960, su próxima generación de aceleradores de IA, con la que quiere tapar el hueco que Nvidia deja en el mercado chino. El 960DT, la variante de decode y entrenamiento, llegará en el primer trimestre de 2027, tres trimestres antes de lo previsto, con hasta 288 GB de memoria y 4 petaFLOPS en FP4. La compañía ha enseñado además un 960PR orientado a prefill y un adelanto de la serie 970, prevista para 2028.
El 960DT dobla en rendimiento y capacidad de memoria a la serie 950 que Huawei lanzó este año. La memoria es propia, de tipo HiZQ, la alternativa de la casa a la HBM que usa el resto del sector. Frente a lo que Nvidia vende fuera de China la comparación es menos lucida: el B300 ofrece memoria y ancho de banda parecidos, pero la mitad de FP8 y un tercio de FP4. Y contra un Rubin, que va de 35 a 50 petaFLOPS en FP4 con 288 GB de HBM4 y 22 TB/s, juega en otra liga. El matiz que importa es que ni Rubin ni el MI455X de AMD se pueden comprar en China, así que la referencia real es otra.
Escalar en lugar de apretar
Donde Huawei no llega por densidad de cómputo, intenta llegar por escala. Para los 960 usa óptica empaquetada (NPO) y lleva el dominio de cómputo hasta 4.096 chips, con 16 exaFLOPS de FP4 en total. Nvidia y AMD empaquetan 72 GPU por rack y suben a 576 con interconexión óptica, así que la apuesta china es juntar más chips antes que tener el mejor chip suelto.
La compañía asegura que la NPO le ha permitido sustituir 48.000 módulos ópticos de 800 Gbps por 5.500 unidades Hi-One, recortando 550 kW de consumo y la mitad de los fallos. El 99,8% de disponibilidad que promete es cifra suya, no de un tercero. En el capítulo de escala, Huawei dice haber llevado un superpod TaiShan basado en 950 hasta 4.096 aceleradores con una topología Clos de dos niveles y cuatro planos, y habla de clústeres de 512.000 NPUs e incluso de un millón. Eso último es teórico: no hay despliegue que lo demuestre.
El detalle no es menor para los desarrolladores chinos, presionados para adoptar alternativas domésticas. DeepSeek tuvo problemas para entrenar con NPUs anteriores de Huawei y acabó volviendo a las GPU de Nvidia, según lo publicado.
Piezas complementarias
El 960PR, previsto para el tercer trimestre de 2027, renuncia a memoria y ancho de banda a cambio de cómputo de baja precisión: 8 petaFLOPS en FP4, 192 GB de memoria HiBL y 2,4 TB/s. La idea es repartir el trabajo: el prefill, intensivo en cómputo, va al PR, y el decode, intensivo en memoria, al DT. Es un esquema heterogéneo parecido al de Nvidia con Vera Rubin y Groq LPX, salvo que a Huawei le falta un acelerador de decode con SRAM. Para 2028, la serie 970 promete 3,6 petaFLOPS en FP8 o 14 en FP4, los mismos 288 GB y más ancho de banda.
Todas las cifras son de Huawei y ninguna sale de un benchmark independiente. Aun así, la jugada es clara: si no puede igualar el cómputo por chip, que compense la red, que es su terreno, y que el conjunto aguante. Para quien monta infraestructura de IA en China la pregunta ya no es cuánto rinde un acelerador suelto, sino cuántos se pueden juntar sin que la red se caiga.


