HuaweiがAscend 960を9か月前倒し。勝負どころはダイではなく規模だ

960DTは2027年第1四半期に288GB、FP4で4 PFLOPSを引っ提げて登場する。チップ単体ではRubinに遠く及ばないが、Huaweiが売るのは加速器4096基のポッドであり、そもそもNvidiaはRubinを中国へ出荷できない

|5分で読める0
Huawei's Ascend 960 roadmap leans on rack-scale systems, tying 4,096 accelerators into a single liquid-cooled Atlas SuperPoD rather than chasing Nvidia on per-chip compute
Huawei's Ascend 960 roadmap leans on rack-scale systems, tying 4,096 accelerators into a single liquid-cooled Atlas SuperPoD rather than chasing Nvidia on per-chip compute

HuaweiがConnectカンファレンスで、Ascend 960DTの投入を3四半期前倒しし2027年第1四半期に設定した。あわせて、近接パッケージ光学で加速器4096基を束ねたAtlas SuperPoDを打ち出している。チップ単体で見れば、Nvidiaの次世代には大きく水をあけられている。ただしその差は聞こえるほど重くないかもしれない。中国国内で実際に競合するのは、米国の輸出規制がいまなお認めているチップだからだ。

要点

  • Ascend 960DTは2027年第1四半期に登場する。最大288GBのメモリを9.6TB/sで駆動し、FP8で2 PFLOPS、FP4で4 PFLOPSを出す。今年前半に出荷した950シリーズに対し、演算性能も容量も倍増した。
  • 対になる960PRは2027年第3四半期に続く。FP4で8 PFLOPSを出す一方、メモリは192GB・2.4TB/sに絞られる。推論を分割し、プリフィルを一方のチップ、デコードをもう一方のチップが担う構成だ。
  • Huaweiは近接パッケージ光学により、800Gbpsのプラガブルトランシーバ約4万8000個をHi-ONEモジュール約5500個に集約し、550キロワットを削減して障害率を半減させたとしている。

960シリーズが実際に提供するもの

デコードと学習を意味するDTを冠した960DTは、最大288GBのメモリを9.6TB/sで動かす。950世代比で帯域幅は約2.4倍に跳ね上がり、チップ間インターコネクトは2.2TB/sを備える。演算性能はFP8で2ペタフロップス、FP4で4ペタフロップスだ。Huaweiは標準のFPおよびMX形式と並行して、独自のHiF8・HiF4という数値形式も推し進めている。精度とダイナミックレンジの両方に合わせ込んだ単一形式が、従来の二つを置き換えられるという主張である。

2四半期遅れて登場する960PRは、このトレードオフを反転させる。FP4のスループットを8ペタフロップスへ倍増させる代わりに、メモリを192GB・2.4TB/sへ落とす。これは推論のプリフィル段階にちょうど適した形だ。プロンプトを演算負荷の高い一度のパスで処理する区間だからである。トークンが実際に流れ出るメモリ律速のデコード段階は960DTが担う。Nvidiaも中止となったRubin CPXで同じ分業を狙っており、GoogleのTPUポッドは以前から同じ論理に寄りかかってきた。

Nvidiaとの差はどの程度か

The Registerによる仕様の読み解きは、960DTをメモリと帯域幅でNvidiaのB300ファミリーに近い位置に置きつつ、FP8の演算は約半分、FP4は3分の1程度だと指摘する。HBM4を288GB、22TB/sで備えFP4で35〜50ペタフロップスを謳うRubinと比べれば、差は小さくない。

ただしこの市場で繰り返し効いてくる条件がある。RubinもAMDのMI455Xも中国では販売できない。Nvidiaが現在そこへ出荷を認められている最良の加速器を基準にすれば、960DTは密な浮動小数点演算で十分に渡り合い、メモリも帯域幅も大きく上回り、はるかに大規模なスケールアップドメインに対応する。2027年向けのハードウェアを選ぶ中国の研究機関にとっては、こちらが実際の比較対象になる。

本当の製品はポッドである

Huaweiの最大の持ち札はネットワーキングであり、もともとの本業でもある。2027年第3四半期投入予定で液冷式のAtlas 960E SuperPoDは、加速器4096基を単一の統合メモリドメインに束ね、FP8で8エクサフロップス、FP4で16エクサフロップスを掲げる。プラガブルトランシーバではなく近接パッケージ光学で構成されており、Huaweiはこの切り替えで800Gbpsのプラガブル約4万8000個をHi-ONEエンジン約5500基に置き換え、550キロワット超を節減し、障害率を半減させて可用性99.8%に達したとしている。

Atlas 950との比較では、10兆パラメータ規模のワークロードで学習スループット2.3倍、推論スループット2.5倍、推論レイテンシは約70%低減と主張する。ポッド単体を超える構成では、RoCEまたは自社のLingquファブリックで加速器51万2000基まで連結でき、マルチレール構成をとればNPU100万基規模のクラスタも射程に入るという。最後の数字は実際の導入ではなく机上の構成であり、成果ではなくロードマップとして読むのが妥当だ。

ロードマップを信じる前に見るべきもの

現実的な論点はスライドではなく、このシリコンで実際にモデルを学習させられるかどうかである。DeepSeekは旧世代のAscendでの学習につまずき、Nvidiaのハードウェアへ戻ったと報じられている。演算能力ではなくソフトウェアと安定性の問題であり、インターコネクトを速くするだけでは解決しない類のものだ。イベントで示されたロードマップには、2028年にFP4で14ペタフロップス・14.4TB/sのAscend 970、2029年にFP4で28ペタフロップス・384GBの980まで描かれている。とはいえ、この業界の3年先のロードマップは下書きにすぎない。

それでも方向性は、一層上で起きている動きと符合する。開発者向けのルーティングプラットフォームでは、中国製のオープンウェイトモデルがシェアを伸ばしてきた。ベンチマークで勝つチップと、性能は十分なだけでも量が確保でき9か月前倒しで届く国産の学習基盤とでは、戦略的な意味がまったく異なる。

よくある質問

Ascend 960チップはいつ出荷されますか?

Huaweiによれば、960DTは当初計画より3四半期早い2027年第1四半期、960PRは2027年第3四半期に登場します。これらを収めるAtlas 960E SuperPoDも2027年第3四半期が目標です。現時点で出荷されているものはありません。

Ascend 960DTはNvidiaのRubinと競争できますか?

純粋な演算性能では及びません。RubinはFP4で35〜50ペタフロップスとされるのに対し、960DTは4ペタフロップスです。ただしメモリ容量は同程度です。Huaweiの反論はダイ単体の性能ではなく規模、すなわち単一の一貫したドメインに束ねた加速器4096基にあります。

近接パッケージ光学とは何で、なぜここで重要なのですか?

近接パッケージ光学は、独立したプラガブルトランシーバモジュールを使わず、光エンジンをチップパッケージのすぐ隣に配置する方式です。Huaweiはこれによりプラガブル約4万8000個をHi-ONEユニット約5500基へ減らし、550キロワット超を節減して障害率を半減させたとしています。4096チップ規模のスケールアップドメインを現実に運用可能にしているのがこの部分です。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

ファンCEO、エヌビディアの70%成長見通しを堅持「1ドル投じて100ドルが返る」
Tech & Business

ファンCEO、エヌビディアの70%成長見通しを堅持「1ドル投じて100ドルが返る」

ジェンスン・ファンCEOがエヌビディアの70%成長見通しを再確認しました。売上高6800億ドルを意味する数字で、循環取引批判には「1ドル投じて100ドル」と答えました。

Seung Jung7 日前
OpenAI「自社モデルがJalapeñoの設計を9か月に短縮した」
Tech & Business

OpenAI「自社モデルがJalapeñoの設計を9か月に短縮した」

AIが書いたカーネルがOpenAIの専門家による実装を最大1.8倍上回った。JalapeñoのInferenceXベンチマーク結果が初公開された。

Seung Jung23 日前
エヌビディアは270億ドルを投じながら企業結合の届出を一度も行わなかった。司法省がその理由を問う
Tech & Business

エヌビディアは270億ドルを投じながら企業結合の届出を一度も行わなかった。司法省がその理由を問う

反トラスト当局が、AI業界で買収に取って代わった取引スキームを初めて本格的に調べ始めました。エヌビディアは司法省から正式な資料提出要求を受けています。

Seung Jung6 日前
Crusoe、309億ドルの評価額で39億ドルを調達——トラックで運べるデータセンターに賭ける
Tech & Business

Crusoe、309億ドルの評価額で39億ドルを調達——トラックで運べるデータセンターに賭ける

データセンター開発会社Crusoeが、ポストマネー評価額309億ドルで39億ドル規模のシリーズF初回クローズを発表しました。評価額は10か月で3倍になりました。

Seung Jung8 時間前
NVIDIA、指標を「メガワットあたりトークン」へ Lambdaが最初の実測値を示す
Tech & Business

NVIDIA、指標を「メガワットあたりトークン」へ Lambdaが最初の実測値を示す

AI Infra SummitでNVIDIAがAIインフラの物差しをメガワットあたりトークンへ再定義した。Lambdaの24%の処理量向上と新しいエージェント型ベンチマークの結果が裏付けだ。

Seung Jung一昨日
Moonshot AI、Kimi K3で売上3倍 年間20億ドルを視野に
Tech & Business

Moonshot AI、Kimi K3で売上3倍 年間20億ドルを視野に

Moonshot AIは、Kimi K3投入後の8月に年換算売上が10億ドルを超えたとして、年末までに20億ドルを目指すと投資家に説明した。

Seung Jung6 日前