Huawei aprovechó su conferencia Connect para adelantar tres trimestres el Ascend 960DT, hasta el primer trimestre de 2027, y lo presentó junto a un Atlas SuperPoD de 4.096 aceleradores construido sobre óptica de proximidad al encapsulado. Chip a chip, la pieza sigue muy por detrás de la próxima generación de Nvidia. Eso puede importar menos de lo que parece, porque los chips contra los que compite realmente dentro de China son los que las normas de exportación estadounidenses todavía permiten.
Claves del anuncio
- El Ascend 960DT llega en el primer trimestre de 2027 con hasta 288GB de memoria a 9,6 TB/s y 2 PFLOPS en FP8 o 4 PFLOPS en FP4: el doble de cómputo y de capacidad que la serie 950 lanzada a principios de este año.
- Un 960PR complementario llegará en el tercer trimestre de 2027 con 8 PFLOPS en FP4 pero solo 192GB a 2,4 TB/s, repartiendo la inferencia de modo que el prellenado corra en un chip y la decodificación en el otro.
- Huawei afirma que la óptica de proximidad le permitió sustituir unos 48.000 transceptores enchufables de 800 Gbps por unos 5.500 módulos Hi-ONE, ahorrando 550 kilovatios y reduciendo a la mitad la tasa de fallos.
Qué ofrece realmente la serie 960
El 960DT — DT por decodificación y entrenamiento — monta hasta 288GB de memoria a 9,6 TB/s, un salto de ancho de banda de alrededor de 2,4 veces frente a la generación 950, más 2,2 TB/s de interconexión entre chips. El cómputo queda en 2 petaFLOPS en FP8 y 4 petaFLOPS en FP4. Huawei también impulsa sus formatos numéricos propios HiF8 y HiF4 junto a los tipos estándar FP y MX, con el argumento de que un único formato ajustado tanto a la precisión como al rango dinámico puede reemplazar a dos convencionales.
El 960PR, previsto dos trimestres después, invierte el equilibrio. Duplica el rendimiento en FP4 hasta 8 petaFLOPS mientras baja a 192GB a 2,4 TB/s, que es justo la forma que conviene para la fase de prellenado de la inferencia, donde el prompt se procesa de una pasada intensiva en cómputo. La fase de decodificación, limitada por memoria y en la que los tokens salen uno a uno, se queda en el 960DT. Nvidia apuntaba a esa misma división con su cancelado Rubin CPX, y los pods de TPU de Google llevan tiempo apoyándose en la misma lógica.
Cuánta distancia hay con Nvidia
La lectura de las especificaciones que hace The Register sitúa al 960DT cerca de la familia B300 de Nvidia en memoria y ancho de banda, pero con aproximadamente la mitad de cómputo en FP8 y un tercio en FP4. Frente a Rubin, que promete entre 35 y 50 petaFLOPS de FP4 con 288GB de HBM4 y 22 TB/s, la brecha no es estrecha.
El matiz es el que se repite en este mercado: ni Rubin ni el MI455X de AMD pueden venderse en China. Medido contra el mejor acelerador que Nvidia tiene permitido enviar allí, el 960DT se defiende en cálculo denso en coma flotante y ofrece bastante más memoria, más ancho de banda y soporte para dominios de escalado vertical mucho mayores. Para un laboratorio chino que elija hardware para 2027, esa es la comparación que obliga.
Por qué el producto real es el pod
La carta más fuerte de Huawei son las redes, el negocio en el que siempre ha estado. El Atlas 960E SuperPoD, previsto para el tercer trimestre de 2027 y refrigerado por líquido, une 4.096 aceleradores en un único dominio de memoria unificado y reclama 8 exaFLOPS en FP8 y 16 exaFLOPS en FP4. Está construido sobre óptica de proximidad en lugar de transceptores enchufables: Huawei sostiene que el cambio sustituyó unos 48.000 módulos de 800 Gbps por unos 5.500 motores Hi-ONE, ahorró más de 550 kilovatios y redujo los fallos a la mitad, hasta una disponibilidad declarada del 99,8%.
Frente al Atlas 950, la compañía afirma 2,3 veces más rendimiento de entrenamiento y 2,5 veces más de inferencia en una carga de 10 billones de parámetros, con una latencia de inferencia un 70% menor. Más allá de un solo pod, asegura que RoCE o su tejido Lingqu pueden encadenar hasta 512.000 aceleradores, y que una topología multirraíl pone a tiro clústeres de un millón de NPU. Esa última cifra es una configuración sobre el papel, no un despliegue, y conviene leerla como hoja de ruta y no como resultado.
Qué vigilar antes de creerse la hoja de ruta
La pregunta práctica no está en las diapositivas, sino en si ese silicio entrena algo. DeepSeek habría tenido problemas entrenando sobre chips Ascend anteriores y volvió a hardware de Nvidia: un fallo de software y de fiabilidad, no de aritmética, y de los que una interconexión más rápida no arregla por sí sola. Las diapositivas de hoja de ruta mostradas en el evento ya esbozan un Ascend 970 para 2028 con 14 petaFLOPS de FP4 y 14,4 TB/s, y un 980 para 2029 con 28 petaFLOPS de FP4 y 384GB, pero en esta industria los planes a tres años son borradores.
Aun así, la dirección encaja con lo que ocurre una capa más arriba, donde los modelos chinos de pesos abiertos vienen ganando cuota en las plataformas de enrutado para desarrolladores. Un sustrato de entrenamiento nacional que sea simplemente suficiente, esté disponible en volumen y llegue nueve meses antes es un objeto estratégico distinto de uno que gana benchmarks.
Preguntas frecuentes
¿Cuándo se envían los chips Ascend 960?
Huawei afirma que el 960DT llega en el primer trimestre de 2027, tres trimestres antes de su calendario original, y que el 960PR le seguirá en el tercer trimestre de 2027. El Atlas 960E SuperPoD que los alberga también apunta al tercer trimestre de 2027. Ninguno se está enviando hoy.
¿Compite el Ascend 960DT con el Rubin de Nvidia?
En cómputo bruto, no. A Rubin se le atribuyen entre 35 y 50 petaFLOPS de FP4 frente a los 4 petaFLOPS del 960DT, aunque ambos chips tienen una capacidad de memoria similar. El contraargumento de Huawei es la escala — 4.096 aceleradores en un dominio coherente — y no el rendimiento por chip.
¿Qué es la óptica de proximidad y por qué importa aquí?
La óptica de proximidad coloca el motor óptico junto al encapsulado del chip en lugar de usar módulos transceptores enchufables aparte. Huawei sostiene que eso redujo unos 48.000 enchufables a cerca de 5.500 unidades Hi-ONE, con un ahorro de más de 550 kilovatios y la mitad de fallos, que es lo que hace operativamente viable un dominio de escalado de 4.096 chips.






