NVIDIAの次世代ラックスケールシステムが9月16日にベンチマークデビューを飾った。掲げられた倍率は大きい。Vera Rubin NVL72はMLPerf Inference v6.1のQwen3-VLワークロードで、すでに出荷中のGB300 NVL72に対し最大3.7倍のスループットを記録した。ただし数字に付いた注釈も同じくらい重い。Vera Rubinが参加したのは、一般提供前のハードウェアを対象とするMLCommonsのプレビュー枠だ。つまり今日発注できる製品の成績ではなく、先を見通すためのシグナルということになる。
要点
- Vera Rubin NVL72はQwen3-VLでGB300 NVL72比最大3.7倍、DeepSeek-R1で最大2.5倍のスループットを出した。ただし提供可能なシステムではなく、プレビュー枠でのMLPerf参加である。
- 4ラックにまたがる288GPUのGB300 NVL72提出は、DeepSeek-R1のオフラインシナリオでスケーリング効率99%に達した。スループットは単一ラックの基準値からほぼ線形に伸びている。
- ソフトウェア最適化だけで、GB300のQwen3-VL成績は6カ月前のMLPerf v6.0比で最大1.6倍に向上した。シリコンは変わっていない。
Vera Rubinが実際に提出したもの
NVIDIAはプレビュー参加を、今回のラウンドで最も重い2つのワークロードに絞った。Qwen3-VLでは自社のオープンソース推論サービング基盤Dynamoと組み合わせてvLLMを走らせ、オフライン・サーバー・インタラクティブの各シナリオでGB300比最大3.7倍のスループットを報告した。DeepSeek-R1ではTensorRT-LLMライブラリに切り替え、最大2.5倍にとどまった。参加範囲を狭めたこと自体が情報である。プレビュー提出とはプラットフォームがどこで最も強く見えるかを選ぶ行為であり、推論とビジョンを扱う2つのワークロードは、ラックスケールのインターコネクトが最も効いてくる領域だ。
同社はこの跳躍の理由を、クロックの引き上げではなくコデザインに求める。Rubinの刷新されたTensor CoreとTransformer Engineは推論のプリフィルとデコードの両方を加速し、NVFP4量子化が重み・アテンション・KVキャッシュのメモリ使用量を圧縮する。どちらの提出も、プリフィルとデコードを別リソースに切り分けるディスアグリゲーテッド・サービングに依拠し、DeepSeek-R1とQwen3-VLがともに用いるMoE層に広いエキスパート並列を適用した。
クラウド事業者のNebiusも同じラウンドに独自のVera Rubin NVL72プレビュー結果を提出している。このハードウェアがNVIDIAの外へすでにどこまで出ているかを示す早い兆候だ。NVIDIAは今回新設されたEdge-AgenticテストにもJetson AGX Thorの結果を提出した。TensorRT Edge-LLMでQwen3.6-27Bを動かした成績である。
ピークより99%スケーリングが効く理由
引用しにくいが、クラスタのサイジングにはより役立つ結果が別にある。NVIDIAはDeepSeek-R1の提出を72GPUのGB300 NVL72 1ラックから288GPUの4ラックまで拡張し、オフラインシナリオでスケーリング効率99%を計測した。
この数字は、ピークスループットでは答えられない問いに答える。4ラック目がコストに見合うのか、である。この水準の効率とは、追加したラックが最初の1台とほぼ同じように働くことを意味し、あらゆる容量計画が暗黙に置いている前提そのものだ。逆にスケーリングが崩れれば、不足はラックを足すたびに積み上がり、運用側はネットワーク待ちで遊んでいるシリコンに金を払うことになる。NVIDIAが功績を認めるのは第6世代NVLinkとNVLinkスイッチファブリックだ。汎用イーサネットに比べパケットレートは10倍、レイテンシは3分の1で、ラック規模でもディスアグリゲーテッド・サービングが成立すると説明する。WAN 2.2のテキスト生成動画テストでは、同じラックスケール構成が5.7秒の720p動画を毎秒0.65本生成した。NVIDIAはこれを単一ノードの9倍のスループットと計算している。
ソフトウェアもシリコンと同じ速さで積み上がる
Rubinの数字の下には、導入コストがゼロの結果が埋もれている。GB300 NVL72のQwen3-VL性能は、6カ月の間隔があるv6.0とv6.1の間で最大1.6倍に伸びた。KVキャッシュの精度を下げ、カーネル融合を増やし、カーネル自体を改良し、ディスアグリゲーテッド・サービングを導入した結果だ。ハードウェアは変わっていない。昨春GB300ラックを購入した運用者にとっては、サービングスタックだけで届いた無償の増設であり、減価償却スケジュールの読み方まで考え直させる話でもある。NVIDIAは提出期限後も最適化が続いたとし、GPT-OSS-120BとDLRMv3で未検証の追加改善があったと述べている。
一点、行を改めて置くべき注釈がある。GB300比でエージェント性能が30倍というNVIDIAの主張は、MLPerfではなくSemiAnalysisのAgentXプレビュー測定に基づくもので、MLCommonsのピアレビューを経ていない。
v6.1ラウンド全体が示すもの
MLCommonsは今回を参加記録のラウンドと呼んだ。初参加6組織を含む30団体が提出し、120システムからデータセンター・エッジ合わせて約486件の結果が集まった。テストも2つ増えた。埋め込み・検索・リランキング・生成を通したエンドツーエンドのRAGパイプラインと、制約のあるデバイス上でのマルチターンなコーディング作業を狙ったEdge Agentic Inferenceテストである。
MLCommonsはまた、アクセラレータ1基あたりのDeepSeek-R1サーバー成績が1年前より5.7倍良くなったとも報告した。この積み上がりが、AmazonがNVIDIAへの発注を200万GPUへ3倍に引き上げたようなハイパースケーラーの動きの背景にある。
展望
追うべき変化は2つある。v6.1の提出者の半数超が、MLCommonsの新しいAPI中心ハーネスを使った。MLPerf Endpointsの土台であり、コンソーシアムはこれがデータセンター向けベンチマークでInferenceに取って代わるとしている。もう1つは、Vera Rubinの数字がプレビューを抜けてavailable枠に移るまで暫定値にとどまる点だ。移った先では競合も同じ条件で対抗提出ができる。それまで3.7倍というプレビュー値の正直な読み方は、購入判断ではなく進行方向である。そしてソフトウェア更新で届いた1.6倍のほうは、すでに手元にある取り分だ。
FAQ — よくある質問
Vera Rubin NVL72は今すぐ購入できるのか
まだできない。MLPerfのプレビュー枠で提出されており、MLCommonsは提出時点で一般提供されていないシステムにこの枠を割り当てている。プレビュー結果もピアレビューは受けるが、顧客が今すぐ導入できるavailable枠の結果と直接比較はできない。
3.7倍はすべてのワークロードに当てはまるのか
当てはまらない。オフライン・サーバー・インタラクティブを通じたQwen3-VLでのベストケースである。DeepSeek-R1ではDynamo併用のvLLMではなくTensorRT-LLMを使い、GB300 NVL72比の伸びは最大2.5倍だった。NVIDIAがVera Rubinの結果を出したのはこの2ベンチマークだけだ。
MLPerf Inference v6.1で新しくなった点は
ベンチマークが2つ加わった。検索から生成までのパイプライン全体を対象とするエンドツーエンドのRAGテストと、エッジデバイス上のマルチターン・エージェント型コーディングを見るEdge Agentic Inferenceテストだ。今回のラウンドでは、インタラクティブシナリオの複数タスクに投機的デコーディングのサポートも追加された。






