Huawei adelanta nueve meses el Ascend 960: el argumento es la escala, no el chip

El 960DT llega en el primer trimestre de 2027 con 288GB y 4 PFLOPS en FP4, todavía muy por detrás de Rubin por chip, pero Huawei vende pods de 4.096 aceleradores y Nvidia no puede enviar Rubin a China de todos modos

|5 min de lectura0
Huawei's Ascend 960 roadmap leans on rack-scale systems, tying 4,096 accelerators into a single liquid-cooled Atlas SuperPoD rather than chasing Nvidia on per-chip compute
Huawei's Ascend 960 roadmap leans on rack-scale systems, tying 4,096 accelerators into a single liquid-cooled Atlas SuperPoD rather than chasing Nvidia on per-chip compute

Huawei aprovechó su conferencia Connect para adelantar tres trimestres el Ascend 960DT, hasta el primer trimestre de 2027, y lo presentó junto a un Atlas SuperPoD de 4.096 aceleradores construido sobre óptica de proximidad al encapsulado. Chip a chip, la pieza sigue muy por detrás de la próxima generación de Nvidia. Eso puede importar menos de lo que parece, porque los chips contra los que compite realmente dentro de China son los que las normas de exportación estadounidenses todavía permiten.

Claves del anuncio

  • El Ascend 960DT llega en el primer trimestre de 2027 con hasta 288GB de memoria a 9,6 TB/s y 2 PFLOPS en FP8 o 4 PFLOPS en FP4: el doble de cómputo y de capacidad que la serie 950 lanzada a principios de este año.
  • Un 960PR complementario llegará en el tercer trimestre de 2027 con 8 PFLOPS en FP4 pero solo 192GB a 2,4 TB/s, repartiendo la inferencia de modo que el prellenado corra en un chip y la decodificación en el otro.
  • Huawei afirma que la óptica de proximidad le permitió sustituir unos 48.000 transceptores enchufables de 800 Gbps por unos 5.500 módulos Hi-ONE, ahorrando 550 kilovatios y reduciendo a la mitad la tasa de fallos.

Qué ofrece realmente la serie 960

El 960DT — DT por decodificación y entrenamiento — monta hasta 288GB de memoria a 9,6 TB/s, un salto de ancho de banda de alrededor de 2,4 veces frente a la generación 950, más 2,2 TB/s de interconexión entre chips. El cómputo queda en 2 petaFLOPS en FP8 y 4 petaFLOPS en FP4. Huawei también impulsa sus formatos numéricos propios HiF8 y HiF4 junto a los tipos estándar FP y MX, con el argumento de que un único formato ajustado tanto a la precisión como al rango dinámico puede reemplazar a dos convencionales.

El 960PR, previsto dos trimestres después, invierte el equilibrio. Duplica el rendimiento en FP4 hasta 8 petaFLOPS mientras baja a 192GB a 2,4 TB/s, que es justo la forma que conviene para la fase de prellenado de la inferencia, donde el prompt se procesa de una pasada intensiva en cómputo. La fase de decodificación, limitada por memoria y en la que los tokens salen uno a uno, se queda en el 960DT. Nvidia apuntaba a esa misma división con su cancelado Rubin CPX, y los pods de TPU de Google llevan tiempo apoyándose en la misma lógica.

Cuánta distancia hay con Nvidia

La lectura de las especificaciones que hace The Register sitúa al 960DT cerca de la familia B300 de Nvidia en memoria y ancho de banda, pero con aproximadamente la mitad de cómputo en FP8 y un tercio en FP4. Frente a Rubin, que promete entre 35 y 50 petaFLOPS de FP4 con 288GB de HBM4 y 22 TB/s, la brecha no es estrecha.

El matiz es el que se repite en este mercado: ni Rubin ni el MI455X de AMD pueden venderse en China. Medido contra el mejor acelerador que Nvidia tiene permitido enviar allí, el 960DT se defiende en cálculo denso en coma flotante y ofrece bastante más memoria, más ancho de banda y soporte para dominios de escalado vertical mucho mayores. Para un laboratorio chino que elija hardware para 2027, esa es la comparación que obliga.

Por qué el producto real es el pod

La carta más fuerte de Huawei son las redes, el negocio en el que siempre ha estado. El Atlas 960E SuperPoD, previsto para el tercer trimestre de 2027 y refrigerado por líquido, une 4.096 aceleradores en un único dominio de memoria unificado y reclama 8 exaFLOPS en FP8 y 16 exaFLOPS en FP4. Está construido sobre óptica de proximidad en lugar de transceptores enchufables: Huawei sostiene que el cambio sustituyó unos 48.000 módulos de 800 Gbps por unos 5.500 motores Hi-ONE, ahorró más de 550 kilovatios y redujo los fallos a la mitad, hasta una disponibilidad declarada del 99,8%.

Frente al Atlas 950, la compañía afirma 2,3 veces más rendimiento de entrenamiento y 2,5 veces más de inferencia en una carga de 10 billones de parámetros, con una latencia de inferencia un 70% menor. Más allá de un solo pod, asegura que RoCE o su tejido Lingqu pueden encadenar hasta 512.000 aceleradores, y que una topología multirraíl pone a tiro clústeres de un millón de NPU. Esa última cifra es una configuración sobre el papel, no un despliegue, y conviene leerla como hoja de ruta y no como resultado.

Qué vigilar antes de creerse la hoja de ruta

La pregunta práctica no está en las diapositivas, sino en si ese silicio entrena algo. DeepSeek habría tenido problemas entrenando sobre chips Ascend anteriores y volvió a hardware de Nvidia: un fallo de software y de fiabilidad, no de aritmética, y de los que una interconexión más rápida no arregla por sí sola. Las diapositivas de hoja de ruta mostradas en el evento ya esbozan un Ascend 970 para 2028 con 14 petaFLOPS de FP4 y 14,4 TB/s, y un 980 para 2029 con 28 petaFLOPS de FP4 y 384GB, pero en esta industria los planes a tres años son borradores.

Aun así, la dirección encaja con lo que ocurre una capa más arriba, donde los modelos chinos de pesos abiertos vienen ganando cuota en las plataformas de enrutado para desarrolladores. Un sustrato de entrenamiento nacional que sea simplemente suficiente, esté disponible en volumen y llegue nueve meses antes es un objeto estratégico distinto de uno que gana benchmarks.

Preguntas frecuentes

¿Cuándo se envían los chips Ascend 960?

Huawei afirma que el 960DT llega en el primer trimestre de 2027, tres trimestres antes de su calendario original, y que el 960PR le seguirá en el tercer trimestre de 2027. El Atlas 960E SuperPoD que los alberga también apunta al tercer trimestre de 2027. Ninguno se está enviando hoy.

¿Compite el Ascend 960DT con el Rubin de Nvidia?

En cómputo bruto, no. A Rubin se le atribuyen entre 35 y 50 petaFLOPS de FP4 frente a los 4 petaFLOPS del 960DT, aunque ambos chips tienen una capacidad de memoria similar. El contraargumento de Huawei es la escala — 4.096 aceleradores en un dominio coherente — y no el rendimiento por chip.

¿Qué es la óptica de proximidad y por qué importa aquí?

La óptica de proximidad coloca el motor óptico junto al encapsulado del chip en lugar de usar módulos transceptores enchufables aparte. Huawei sostiene que eso redujo unos 48.000 enchufables a cerca de 5.500 unidades Hi-ONE, con un ahorro de más de 550 kilovatios y la mitad de fallos, que es lo que hace operativamente viable un dominio de escalado de 4.096 chips.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Huang defiende el 70 % de crecimiento de Nvidia: "Ponemos un dólar y vuelven cien"
Tech & Business

Huang defiende el 70 % de crecimiento de Nvidia: "Ponemos un dólar y vuelven cien"

Huang ratificó la guía del 70 % de Nvidia, que implica 680.000 millones en ingresos, y respondió a las críticas de circularidad: un dólar entra, cien vuelven.

Seung Junghace 7 días
Nvidia gastó 27.000 millones de dólares sin presentar una sola notificación de fusión. El Departamento de Justicia quiere saber por qué
Tech & Business

Nvidia gastó 27.000 millones de dólares sin presentar una sola notificación de fusión. El Departamento de Justicia quiere saber por qué

Las autoridades antimonopolio abrieron el primer examen serio de la estructura que reemplazó a la adquisición en la industria de la IA: Nvidia recibió un requerimiento formal de información del Departamento de Justicia.

Seung Junghace 6 días
Crusoe capta 3.900 millones con una valoración de 30.900 millones y apuesta por centros de datos que caben en un camión
Tech & Business

Crusoe capta 3.900 millones con una valoración de 30.900 millones y apuesta por centros de datos que caben en un camión

La desarrolladora de centros de datos Crusoe anunció el cierre inicial de una Serie F de 3.900 millones de dólares con una valoración post-money de 30.900 millones.

Seung Junghace 8 horas
NVIDIA convierte los tokens por megavatio en la métrica, y Lambda le pone cifra
Tech & Business

NVIDIA convierte los tokens por megavatio en la métrica, y Lambda le pone cifra

En el AI Infra Summit, NVIDIA replanteó la infraestructura de IA en torno a los tokens por megavatio, con el 24% más de rendimiento de Lambda como respaldo.

Seung Junganteayer
Moonshot AI apunta a 2.000 millones de dólares tras triplicar ingresos con Kimi K3
Tech & Business

Moonshot AI apunta a 2.000 millones de dólares tras triplicar ingresos con Kimi K3

Moonshot AI dijo a sus inversores que apunta a 2.000 millones de dólares de ingresos anualizados a cierre de año, después de que Kimi K3 llevara su ritmo por encima de los 1.000 millones en agosto.

Seung Junghace 6 días
Un modelo de 30B superó a uno de 550B en la propia planificación fabril de Nvidia
Tech & Business

Un modelo de 30B superó a uno de 550B en la propia planificación fabril de Nvidia

Nvidia y Palantir publicaron una brecha de 86,7% frente a 55,5% a favor de un modelo de 30B ajustado sobre uno general de 550B en su propia asignación de materiales.

Seung Junghace 5 días