對於再也無法從電力公司多要到一兆瓦的業者來說,只剩下一個槓桿可用:從已經簽下的電力中,榨出更多可以拿去賣的產出。NVIDIA本週的AI Infra Summit主題演講就建立在這套說法上,而且還帶來了客戶端的數字,證明這根槓桿真的推得動。Lambda把19台伺服器塞進通常只配給16台的電力額度裡,換來整座叢集每秒token吞吐量增加24%。
重點摘要
- Lambda導入DSX MaxLPS後,叢集整體token吞吐量從每秒約400萬提升到500萬,每瓦效能提高23%。這是該軟體在Blackwell伺服器上的首次正式環境驗證。
- NVIDIA表示,Vera Rubin NVL72相較GB300 NVL72,每兆瓦吞吐量最高達30倍,每百萬token成本最多降至45分之一。量測對象並非單筆請求,而是重播真實的代理式程式開發工作階段。
- 另一場與Emerald AI合作的示範中,一座AI設施回應了市政電力公司送來的數百筆即時需求訊號,同時沒有干擾優先等級較高的工作。
為什麼衡量標準正在改變
在晶片供給仍是瓶頸的年代,峰值FLOPS作為採購訊號說得通。但在一棟由併網排隊順序、而非採購單決定能跑多少運算的建築裡,這個指標就沒那麼有意義了。NVIDIA超大規模與高效能運算副總裁Ian Buck在週二的高峰會發表中提出的框架很清楚:經過驗證的代理式token除以兆瓦,才是真正對得上營收的數字。
基準測試圈子也往同一個方向走。SemiAnalysis以錄製的真實代理式程式開發工作階段為基礎打造AgentX,保留了脈絡增長、工具呼叫延遲與子代理生成,而不是去計算單一提示的耗時。NVIDIA指出,這樣一次工作階段的token用量約為一般聊天請求的15倍,而且每次呼叫的輸入與輸出長度落差很大。這種負載不是以單筆請求為單位的測試套件描述得清楚的,這也是NVIDIA把AgentX定位成MLPerf 推論測試的補充而非取代的原因。
以這把尺來量,根據NVIDIA公布的AgentX數據,執行DeepSeek V4 Pro的Vera Rubin NVL72每兆瓦吞吐量達到上一代GB300的30倍,每百萬token成本最多下降至45分之一。兩個數字都以上限值而非典型值呈現。
Lambda的結果在實務上說明了什麼
在Lambda這個案例裡,真正發揮作用的是DSX MaxLPS。與其依每座機櫃的最壞情況耗電來配置容量、讓沒用到的部分閒置,這套軟體會持續追蹤GPU與機櫃的耗電,把騰出來的餘裕導向需要的工作。訓練與推論服務的用電形態並不相同,因此在混合部署的環境裡,預設狀態下有相當多的餘裕是白白閒置的。
在電力額度不變的前提下多跑三個節點,聽起來不算驚人,但規模一大就會累積出效果,而且不需要新的變電所、線路或許可。NVIDIA預期下一代的差距會再拉開,估計在同樣的兆瓦上限下,Vera Rubin NVL72站點可多出最高40%的GPU容量與最高35%的token吞吐量。針對受延遲限制的代理工作,NVIDIA也把Vera Rubin與Groq 3 LPX搭配,宣稱在100K脈絡長度的Qwen 3.8 27B執行中,每位使用者每秒可輸出2,529個token。
電網成為架構的一部分
餘波最長的那場示範,其實和晶片沒什麼關係。Emerald AI透過Silicon Valley Power的彈性負載併網方案,展示一座設施依據電力公司訊號自動降載——數百筆訊號——而關鍵工作仍持續運轉。Emerald打算把自家的電力管理產品Conductor建構在NVIDIA DSX Flex之上。DSX Flex會讀取卸載請求、需量反應事件與電價變動,並在業者事先定義的優先順序架構��採取行動。
這項演練的意義,在法規面和技術面同樣重要。電力公司在配給併網容量時,預設資料中心是一塊無法調整的需求。一座能證明自己願意在被要求時讓步的設施,在排隊時就能提出不一樣的說法。這條線索與NVIDIA為AI工廠建設所動員的資金並行,而且瞄準的正是光靠錢解不開的限制。
這些數字能信到什麼程度
這裡的每一個倍數都出自廠商或合作夥伴,在廠商自選的負載上量測,而主打的比較都是現行世代對上前一代。Lambda的數字是值得多給一點權重的例外:那是正式環境的叢集,增幅小到合乎情理,其他跑Blackwell的業者也能自行查證。30倍與45倍的AgentX宣稱則掛在公開儀表板上,至少留下了被挑戰的空間。
合作夥伴消息補齊了其餘版面。Amazon旗下Annapurna Labs正共同開發NVHBM客製記憶體,d-Matrix透過NVLink Fusion把Raptor XPU接上Vera CPU,Pinterest則以Blackwell與Dynamo支撐對話式視覺搜尋。既然NVIDIA已宣稱Vera Rubin進入全面量產,獨立量測應該很快就會出來,替其餘的說法做個了斷。
常見問答
什麼是每兆瓦token?
它是以耗電量、而非晶片數量或峰值FLOPS來標準化的吞吐量。當擴張的上限來自電力併網而不是資本時,這個指標告訴業者:每一兆瓦的合約電力能產出多少可販售的成果。比起硬體規格,它更接近營收數字。
DSX MaxLPS讓Lambda的叢集提升了多少?
Lambda在通常配給16個全功率節點的電力範圍內跑了19個節點,叢集整體token吞吐量提升約24%,從每秒約400萬增加到500萬,每瓦效能提高23%。NVIDIA稱這是MaxLPS在Blackwell伺服器上的首次驗證。
SemiAnalysis的AgentX和MLPerf有何不同?
有。AgentX會重播完整的代理執行軌跡,包含工具呼叫與子代理生成;MLPerf Inference則是在多種模型與情境下評分單筆請求的效能。NVIDIA把兩者視為互補,因為它們針對同一批硬體回答的是不同的問題。






