NVIDIA의 차세대 랙 스케일 시스템이 9월 16일 벤치마크 데뷔전을 치렀다. 앞세운 배수는 크다. Vera Rubin NVL72는 MLPerf Inference v6.1의 Qwen3-VL 워크로드에서 이미 출하 중인 GB300 NVL72 대비 최대 3.7배 처리량을 기록했다. 다만 숫자에 붙은 단서가 숫자만큼 중요하다. Vera Rubin은 아직 일반 판매되지 않는 하드웨어를 다루는 MLCommons 프리뷰 등급으로 참가했다. 지금 주문할 수 있는 제품의 성적이 아니라 앞을 내다보는 신호라는 뜻이다.
핵심 요약
- Vera Rubin NVL72는 Qwen3-VL에서 GB300 NVL72 대비 최대 3.7배, DeepSeek-R1에서 최대 2.5배 처리량을 냈다. 다만 구매 가능한 시스템이 아니라 프리뷰 등급으로 MLPerf에 들어왔다.
- 랙 4대에 걸쳐 GPU 288장을 묶은 GB300 NVL72 제출은 DeepSeek-R1 오프라인 시나리오에서 스케일링 효율 99%에 도달했다. 처리량이 단일 랙 기준선에서 거의 선형으로 늘었다.
- 소프트웨어 최적화만으로 GB300의 Qwen3-VL 성적이 6개월 전 MLPerf v6.0 대비 최대 1.6배 올랐다. 실리콘은 그대로다.
Vera Rubin이 실제로 제출한 것
NVIDIA는 프리뷰 참가를 이번 라운드에서 가장 무거운 워크로드 두 개로 한정했다. Qwen3-VL에서는 자사 오픈소스 서빙 프레임워크 Dynamo와 함께 vLLM을 돌려 오프라인·서버·인터랙티브 시나리오 전반에서 GB300 대비 최대 3.7배 처리량을 보고했다. DeepSeek-R1에서는 TensorRT-LLM 라이브러리로 바꿔 최대 2.5배에 머물렀다. 참가 범위를 좁힌 것 자체가 정보다. 프리뷰 제출은 플랫폼이 어디서 가장 강해 보이는지를 고르는 선택이고, 추론과 비전을 다루는 두 워크로드는 랙 스케일 인터커넥트의 값어치가 가장 크게 드러나는 영역이다.
NVIDIA는 이 도약의 원인을 단순한 클럭 상승이 아닌 코디자인에서 찾는다. Rubin의 개편된 텐서 코어와 트랜스포머 엔진은 추론의 프리필과 디코드 양쪽을 모두 가속하고, NVFP4 양자화는 가중치와 어텐션, KV 캐시가 차지하는 메모리를 줄인다. 두 제출 모두 프리필과 디코드를 별도 자원으로 분리하는 분산 서빙(disaggregated serving)에 기댔고, DeepSeek-R1과 Qwen3-VL이 함께 쓰는 전문가 혼합(MoE) 레이어에 넓은 전문가 병렬화를 적용했다.
클라우드 사업자 Nebius도 같은 라운드에 자체 Vera Rubin NVL72 프리뷰 결과를 냈다. 이 하드웨어가 NVIDIA 울타리 밖으로 이미 얼마나 나갔는지 보여주는 이른 신호다. NVIDIA는 이번에 새로 생긴 Edge-Agentic 테스트에 Jetson AGX Thor 결과도 제출했다. TensorRT Edge-LLM으로 Qwen3.6-27B를 돌린 성적이다.
최대 처리량보다 99% 스케일링이 중요한 이유
인용하기는 덜 좋지만 클러스터 규모를 잡는 쪽에는 더 쓸모 있는 결과가 따로 있다. NVIDIA는 DeepSeek-R1 제출을 GPU 72장짜리 GB300 NVL72 한 랙에서 288장짜리 네 랙으로 키웠고, 오프라인 시나리오에서 스케일링 효율 99%를 측정했다.
이 수치는 최대 처리량이 답하지 못하는 질문에 답한다. 네 번째 랙이 제값을 하느냐다. 효율이 그 수준이라는 말은 추가된 랙이 첫 랙과 거의 똑같이 움직인다는 뜻이고, 모든 용량 계획이 조용히 전제하는 가정이 바로 그것이다. 반대로 스케일링이 무너지면 부족분은 랙을 더할수록 누적되고, 운영자는 네트워크를 기다리며 놀고 있는 실리콘에 비용을 낸다. NVIDIA는 6세대 NVLink와 NVLink 스위치 패브릭을 공을 돌린다. 범용 이더넷보다 패킷 처리율이 10배 높고 지연은 3분의 1이라, 랙 규모에서도 분산 서빙 기법이 성립한다는 설명이다. WAN 2.2 텍스트-투-비디오 테스트에서는 같은 랙 스케일 구성이 초당 0.65개, 길이 5.7초짜리 720p 영상을 만들어냈다. NVIDIA는 이를 단일 노드의 9배 처리량으로 계산한다.
실리콘만큼 빠르게 쌓이는 소프트웨어
Rubin의 숫자 밑에는 도입 비용이 0인 결과가 묻혀 있다. GB300 NVL72의 Qwen3-VL 성능은 6개월 간격인 v6.0과 v6.1 사이에 최대 1.6배 올랐다. KV 캐시 정밀도를 낮추고, 커널 퓨전을 추가하고, 커널 자체를 개선하고, 분산 서빙을 도입한 결과다. 하드웨어는 바뀌지 않았다. 지난봄 GB300 랙을 산 운영자에게는 서빙 스택만으로 받아낸 공짜 증설이며, 감가상각 일정을 어떻게 읽어야 하는지까지 다시 생각하게 만드는 대목이다. NVIDIA는 제출 마감 이후에도 최적화가 이어졌다며 GPT-OSS-120B와 DLRMv3에서 검증되지 않은 추가 개선이 있었다고 밝혔다.
한 가지 단서는 줄을 바꿔 적을 필요가 있다. GB300 대비 에이전트 성능이 30배라는 NVIDIA의 주장은 MLPerf가 아니라 SemiAnalysis AgentX 프리뷰 테스트에서 나왔고, MLCommons의 동료 검증을 거치지 않았다.
v6.1 라운드 전체가 보여주는 것
MLCommons는 이번 라운드를 참가 기록으로 불렀다. 처음 참가한 6곳을 포함해 30개 기관이 제출했고, 시스템 120종에서 데이터센터·엣지 결과가 약 486건 나왔다. 테스트도 둘 늘었다. 임베딩·검색·재순위·생성을 아우르는 엔드투엔드 RAG 파이프라인, 그리고 제약된 기기에서 멀티턴 코딩 워크로드를 겨냥한 Edge Agentic Inference 테스트다.
MLCommons는 가속기 한 장당 DeepSeek-R1 서버 성적이 1년 전보다 5.7배 좋아졌다고도 밝혔다. 이렇게 쌓이는 개선이 Amazon이 NVIDIA 물량을 GPU 200만 장으로 세 배 늘린 것 같은 하이퍼스케일러 발주의 배경이다.
전망
지켜볼 변화가 둘이다. v6.1 제출자의 절반 이상이 MLCommons의 새 API 중심 하네스를 썼다. MLPerf Endpoints의 토대이며, 컨소시엄은 이것이 데이터센터 벤치마킹에서 Inference를 대체할 것이라고 말한다. 다른 하나는 Vera Rubin의 숫자가 플랫폼이 프리뷰를 벗어나 available 등급으로 옮겨가기 전까지는 잠정치로 남는다는 점이다. 그때가 되면 경쟁사도 같은 조건에서 맞붙는 성적을 제출할 수 있다. 그전까지 3.7배라는 프리뷰 수치를 정직하게 읽는 법은 구매 결정이 아니라 진행 방향으로 보는 것이다. 그리고 소프트웨어 업데이트로 도착한 1.6배 쪽이 이미 테이블에 올라와 있는 몫이다.
FAQ — 자주 묻는 질문
Vera Rubin NVL72는 지금 살 수 있나
아직 아니다. MLPerf의 프리뷰 등급으로 제출됐는데, MLCommons는 제출 시점에 일반 판매되지 않는 시스템에 이 등급을 준다. 프리뷰 결과도 동료 검증을 거치지만, 고객이 지금 배치할 수 있는 available 등급 결과와 직접 비교할 수는 없다.
3.7배가 모든 워크로드에 적용되나
아니다. 오프라인·서버·인터랙티브 시나리오를 통틀어 Qwen3-VL에서 나온 최상의 수치다. DeepSeek-R1에서는 Dynamo 기반 vLLM 대신 TensorRT-LLM을 썼고, GB300 NVL72 대비 향상 폭은 최대 2.5배였다. NVIDIA가 Vera Rubin 결과를 낸 벤치마크는 이 두 개뿐이다.
MLPerf Inference v6.1에서 새로 추가된 것은
벤치마크 두 개가 합류했다. 검색과 생성 파이프라인 전체를 다루는 엔드투엔드 RAG 테스트, 그리고 엣지 기기에서 멀티턴 에이전트 코딩을 보는 Edge Agentic Inference 테스트다. 이번 라운드는 인터랙티브 시나리오의 여러 과제에 추측 디코딩 지원도 추가했다.






