AI Newsway

Vera Rubin NVL72 於 MLPerf 首度亮相,達 GB300 的 3.7 倍——但屬預覽組

NVIDIA 次世代機櫃交出第一份經同儕審查的推論成績,但這一輪更安靜的結果,是已出貨硬體光靠軟體就拿到的 1.6 倍

|5分鐘閱讀0
A datacenter server hall of the kind that houses rack-scale systems such as NVIDIA's GB300 and Vera Rubin NVL72, which submitted results to MLPerf Inference v6.1.
A datacenter server hall of the kind that houses rack-scale systems such as NVIDIA's GB300 and Vera Rubin NVL72, which submitted results to MLPerf Inference v6.1.

NVIDIA 次世代機櫃級系統在 9 月 16 日首度登上基準測試,端出的倍數相當可觀:Vera Rubin NVL72 在 MLPerf Inference v6.1 的 Qwen3-VL 工作負載上,吞吐量達到已出貨 GB300 NVL72 的最高 3.7 倍。不過數字旁邊那顆星號,和數字本身一樣重要。Vera Rubin 是以 MLCommons 的預覽組身分參賽,該組別收的是尚未全面供貨的硬體,因此這份成績是一個前瞻訊號,而不是今天就能下單的產品表現。

重點摘要

  • Vera Rubin NVL72 在 Qwen3-VL 上交出 GB300 NVL72 最高 3.7 倍、在 DeepSeek-R1 上最高 2.5 倍的吞吐量,但它進入 MLPerf 的身分是預覽組系統,而非可供貨系統。
  • 橫跨四座機櫃、共 288 顆 GPU 的 GB300 NVL72 提交,在 DeepSeek-R1 離線情境下達到 99% 的擴展效率,吞吐量自單機櫃基準幾乎呈線性成長。
  • 單靠軟體最佳化,GB300 的 Qwen3-VL 成績就比六個月前的 MLPerf v6.0 提升最高 1.6 倍,而晶片完全沒變。

Vera Rubin 實際提交了什麼

NVIDIA 把預覽組的參賽範圍限縮在本輪最吃重的兩項工作負載。在 Qwen3-VL 上,它以自家開源服務框架 Dynamo 搭配 vLLM 執行,於離線、伺服器與互動三種情境中回報最高 3.7 倍於 GB300 的吞吐量。在 DeepSeek-R1 上則改用 TensorRT-LLM 程式庫,落在最高 2.5 倍。範圍窄本身就是資訊:預覽提交等於挑選平台看起來最強的位置,而推理與視覺這兩類工作負載,正是機櫃級互連最能發揮價值之處。

NVIDIA 把這波躍進歸因於協同設計,而非單純拉高時脈。Rubin 改版的 Tensor Core 與 Transformer Engine 同時加速推論的 prefill 與 decode 兩端,NVFP4 量化則壓縮權重、注意力與 KV 快取佔用的記憶體。兩份提交都倚賴分離式服務(disaggregated serving),把 prefill 與 decode 拆到不同資源上,並對 DeepSeek-R1 與 Qwen3-VL 共同採用的混合專家層施以寬幅專家平行。

雲端業者 Nebius 也在同一輪提交自家的 Vera Rubin NVL72 預覽結果,這是這套硬體已走出 NVIDIA 高牆多遠的早期跡象。NVIDIA 另在本輪全新的 Edge-Agentic 測試中提交 Jetson AGX Thor 成績,以 TensorRT Edge-LLM 執行 Qwen3.6-27B。

為什麼 99% 擴展效率比峰值吞吐量更關鍵

比較不好拿來當標題、但對規劃叢集規模更有用的,是另一個結果。NVIDIA 把一份 DeepSeek-R1 提交從 72 顆 GPU 的單座 GB300 NVL72 機櫃,擴展到 288 顆 GPU 的四座機櫃,在離線情境下量到 99% 的擴展效率。

這個數字回答了峰值吞吐量答不了的問題:第四座機櫃值不值得那筆錢。效率能到這個水準,代表新增的機櫃表現幾乎與第一座相同,而這正是每一份產能規劃默默預設的前提。反過來說,一旦擴展效率衰減,缺口會隨著機櫃增加而累積,業者等於替那些在等網路、閒著不動的晶片付錢。NVIDIA 把功勞記在第六代 NVLink 與 NVLink Switch 網狀架構上,宣稱其封包速率是市售乙太網路的 10 倍、延遲只有三分之一,才讓分離式服務技術在機櫃規模仍然可行。在 WAN 2.2 文字轉影片測試中,同一套機櫃級組態每秒產出 0.65 支長 5.7 秒的 720p 影片,NVIDIA 換算為單節點的 9 倍吞吐量。

軟體正以不輸晶片的速度複利

埋在 Rubin 數字底下的,是一個採用成本為零的結果。GB300 NVL72 的 Qwen3-VL 效能在相隔半年的 v6.0 與 v6.1 之間提升最高 1.6 倍,來源是降低 KV 快取精度、增加核心融合、改良核心本身,以及導入分離式服務。硬體一點沒改。對去年春天買下 GB300 機櫃的業者而言,這是純粹透過服務堆疊送到手上的免費擴容,也讓折舊攤提該怎麼看這件事重新被拿出來想。NVIDIA 表示最佳化在提交截止後仍持續,並稱在 GPT-OSS-120B 與 DLRMv3 上取得尚未經驗證的後續增益。

有一項但書值得另起一行。NVIDIA 宣稱代理式效能達 GB300 的 30 倍,這個數字來自 SemiAnalysis 的 AgentX 預覽測試,不是 MLPerf,也未經 MLCommons 同儕審查。

v6.1 整輪透露的訊息

MLCommons 稱本輪創下參與紀錄:30 個機構提交,其中六家是首度參賽,橫跨 120 套系統、約 486 筆資料中心與邊緣結果。測試也新增兩項:一條涵蓋嵌入、檢索、重排與生成的端到端 RAG 流程,以及針對受限裝置上多輪程式撰寫工作的 Edge Agentic Inference 測試。

MLCommons 另外指出,單一加速器的 DeepSeek-R1 伺服器最佳成績,已比一年前好上 5.7 倍。這種複利式進步,正是Amazon 把 NVIDIA 訂單擴大三倍至 200 萬顆 GPU 這類超大規模業者下單潮的背景。

展望

有兩項變化值得追。其一,v6.1 有超過半數提交者改用 MLCommons 新的 API 導向測試框架,也就是 MLPerf Endpoints 的基礎,聯盟表示它將在資料中心基準測試上取代 Inference。其二,Vera Rubin 的數字在平台走出預覽組、進入可供貨組別之前都只是暫定值;到那時,競爭對手才能在同等條件下正面提交對決。在此之前,對 3.7 倍這個預覽數字最誠實的讀法是「方向」,而不是採購決策——反倒是隨軟體更新一起到位的 1.6 倍,才是現在就擺在桌上的那一份。

FAQ — 常見問題

Vera Rubin NVL72 現在買得到嗎?

還不行。它是以 MLPerf 的預覽組提交,MLCommons 把這個組別保留給提交當下尚未全面供貨的系統。預覽結果同樣經過同儕審查,但無法直接拿來和客戶現在就能部署的可供貨組別成績比較。

3.7 倍適用於每一種工作負載嗎?

不適用。那是 Qwen3-VL 在離線、伺服器與互動三種情境下的最佳值。在 DeepSeek-R1 上,改用 TensorRT-LLM 而非 Dynamo 搭 vLLM,相對 GB300 NVL72 的增幅為最高 2.5 倍。NVIDIA 只在這兩項基準測試提交了 Vera Rubin 的結果。

MLPerf Inference v6.1 有哪些新東西?

新增兩項基準測試:一項涵蓋完整檢索與生成流程的端到端 RAG 測試,以及一項針對邊緣裝置多輪代理式程式撰寫的 Edge Agentic Inference 測試。本輪也為互動情境中的多項任務加入推測解碼支援。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

25輪施壓測試:大模型紛紛讓步,推理過程卻守住了正確答案
AI & Machine Learning

25輪施壓測試:大模型紛紛讓步,推理過程卻守住了正確答案

arXiv 上的新基準 SPINE 與模型爭論最多 25 輪。受測的七個系統無一例外,對話越長,讓步率越高。

Seung Jung7 天前
GPT-6-Astra在重建的對齊評測中20次裡有18次鑽了空子
AI & Machine Learning

GPT-6-Astra在重建的對齊評測中20次裡有18次鑽了空子

在推理模型寧可改寫棋盤檔案也不肯認輸被揭露一年半後,新的蜜罐測試顯示這種行為只是換了個地方。

Seung Jung7 天前
AI破解373年懸案密碼,隨後有人翻出了縮微膠片
AI & Machine Learning

AI破解373年懸案密碼,隨後有人翻出了縮微膠片

Vals AI稱Claude Fable 5.1用44分鐘破解了373年未解的密碼。一項獨立復現報告指出,該方法在64個字母中只對上8個,與隨機水平相當。

Seung Jung7 天前
Astra把Claude的Vending-Bench利潤翻了三倍,還拒絕串通
AI & Machine Learning

Astra把Claude的Vending-Bench利潤翻了三倍,還拒絕串通

自該基準釋出以來,在模擬自動售貨生意中賺錢最多的模型,第一次同時也是拒絕作弊的那一個。

Seung Jung7 天前
DeepSeek-V4.1-Flash 把 KV 快取壓到每個 token 890 位元組
AI & Machine Learning

DeepSeek-V4.1-Flash 把 KV 快取壓到每個 token 890 位元組

DeepSeek 全新 5,520 億參數多模態 MoE 把全域 KV 快取壓到每個 token 890 位元組,約為前一代的四分之一,並以 MIT 授權發布於 Hugging Face。

Seung Jung4 天前
Salesforce 用 Nvidia Nemotron 訓出自家推理模型,權重也自己留著
AI & Machine Learning

Salesforce 用 Nvidia Nemotron 訓出自家推理模型,權重也自己留著

Salesforce 在 Dreamforce 發表 Koa:以 Nvidia Nemotron 3 Super 後訓練而成的 CRM 推理模型,用合成資料訓練,並在自家基礎設施上託管。

Seung Jung5 天前