Vera Rubin NVL72 debuta en MLPerf con 3,7x el GB300, pero como pieza en vista previa

El próximo rack de NVIDIA presentó sus primeras cifras de inferencia revisadas por pares, aunque el resultado más silencioso de la ronda fue una mejora de 1,6x lograda solo con software sobre hardware ya en el mercado

|5 min de lectura0
A datacenter server hall of the kind that houses rack-scale systems such as NVIDIA's GB300 and Vera Rubin NVL72, which submitted results to MLPerf Inference v6.1.
A datacenter server hall of the kind that houses rack-scale systems such as NVIDIA's GB300 and Vera Rubin NVL72, which submitted results to MLPerf Inference v6.1.

El sistema a escala de rack de próxima generación de NVIDIA debutó en los benchmarks el 16 de septiembre, y el multiplicador que encabeza el anuncio es grande: Vera Rubin NVL72 alcanzó hasta 3,7 veces el rendimiento del GB300 NVL72 ya disponible en la carga de trabajo Qwen3-VL de MLPerf Inference v6.1. El asterisco importa tanto como la cifra. Vera Rubin participó en la categoría de vista previa de MLCommons, reservada para hardware que todavía no está disponible de forma general, así que el resultado es una señal de hacia dónde va la plataforma y no algo que un comprador pueda encargar hoy.

Claves del resultado

  • Vera Rubin NVL72 entregó hasta 3,7x el rendimiento del GB300 NVL72 en Qwen3-VL y hasta 2,5x en DeepSeek-R1, pero entró en MLPerf como sistema en vista previa y no como producto disponible.
  • Una presentación de GB300 NVL72 con 288 GPU repartidas en cuatro racks llegó al 99% de eficiencia de escalado en el escenario offline de DeepSeek-R1, con un rendimiento que creció de forma casi lineal desde la base de un solo rack.
  • Solo con optimización de software, los resultados de GB300 en Qwen3-VL subieron hasta 1,6x frente a MLPerf v6.0, seis meses antes, sin tocar el silicio.

Qué presentó realmente Vera Rubin

NVIDIA limitó su entrada en vista previa a las dos cargas más exigentes de la ronda. En Qwen3-VL ejecutó vLLM junto a Dynamo, su framework de servicio de código abierto, y reportó hasta 3,7x el rendimiento del GB300 en los escenarios offline, servidor e interactivo. En DeepSeek-R1 cambió a la biblioteca TensorRT-LLM y se quedó en hasta 2,5x. Lo acotado de la entrada dice algo por sí solo: una presentación en vista previa es una decisión sobre dónde luce más fuerte una plataforma, y dos cargas de razonamiento y visión son justo donde la interconexión a escala de rack rinde más.

La compañía atribuye el salto al codiseño más que a la frecuencia de reloj. Los Tensor Cores revisados y el Transformer Engine de Rubin aceleran tanto la fase de prefill como la de decodificación de la inferencia, mientras que la cuantización NVFP4 reduce la memoria que ocupan los pesos, la atención y la caché KV. Ambas presentaciones se apoyaron en servicio desagregado —separar prefill y decodificación en recursos distintos— y en un paralelismo amplio de expertos sobre las capas de mezcla de expertos que usan tanto DeepSeek-R1 como Qwen3-VL.

El proveedor de nube Nebius presentó sus propios resultados de Vera Rubin NVL72 en vista previa en la misma ronda, una señal temprana de hasta dónde ha viajado ya este hardware fuera de los muros de NVIDIA. NVIDIA también envió resultados de Jetson AGX Thor en la prueba Edge-Agentic, estrenada en esta ronda, ejecutando Qwen3.6-27B con TensorRT Edge-LLM.

Por qué el 99% de escalado importa más que el pico

El resultado menos citable quizá sea el más útil para quien deba dimensionar un clúster. NVIDIA escaló una presentación de DeepSeek-R1 desde un rack GB300 NVL72 de 72 GPU hasta cuatro racks con 288 GPU, y midió un 99% de eficiencia de escalado en el escenario offline.

Esa cifra responde a una pregunta que el rendimiento pico no alcanza: si el cuarto rack justifica su costo. Una eficiencia así significa que el rack marginal se comporta casi como el primero, que es el supuesto del que depende en silencio cualquier plan de capacidad. Cuando el escalado se degrada, en cambio, el déficit se acumula con cada rack añadido y el operador paga por silicio que espera a la red. NVIDIA atribuye el mérito a su NVLink de sexta generación y al conmutador NVLink, que según la empresa mueve tasas de paquetes 10 veces mayores y una latencia tres veces menor que Ethernet comercial, lo que mantiene viable el servicio desagregado a escala de rack. En la prueba de texto a video WAN 2.2, la misma configuración produjo 0,65 videos 720p por segundo, de 5,7 segundos cada uno, lo que NVIDIA calcula como nueve veces el rendimiento de un solo nodo.

El software avanza tan rápido como el silicio

Bajo las cifras de Rubin hay un resultado que no cuesta nada adoptar. El rendimiento del GB300 NVL72 en Qwen3-VL mejoró hasta 1,6x entre v6.0 y v6.1, con seis meses de diferencia, gracias a menor precisión en la caché KV, más fusión de kernels, mejores kernels y servicio desagregado. El hardware no cambió. Para quien compró un rack GB300 la primavera pasada, eso es capacidad extra gratuita entregada por completo desde la pila de servicio, y obliga a releer cómo se plantea un calendario de amortización. NVIDIA afirma que la optimización siguió después del cierre de presentaciones, con mejoras posteriores no verificadas en GPT-OSS-120B y DLRMv3.

Una advertencia merece renglón aparte. La afirmación de NVIDIA de un rendimiento agéntico 30 veces superior al del GB300 procede de pruebas en vista previa de AgentX, de SemiAnalysis, no de MLPerf, y no ha pasado por la revisión por pares de MLCommons.

Qué muestra el conjunto de la ronda v6.1

MLCommons calificó la ronda de récord de participación, con 30 organizaciones que presentaron resultados, seis de ellas por primera vez, y alrededor de 486 resultados de centro de datos y edge repartidos en 120 sistemas. La suite sumó dos pruebas: una tubería RAG de extremo a extremo que cubre embedding, recuperación, reordenamiento y generación, y la prueba Edge Agentic Inference, orientada a cargas de programación multiturno en dispositivos limitados.

MLCommons informó además de que el mejor resultado de DeepSeek-R1 por acelerador en escenario de servidor es ahora 5,7 veces superior al de hace un año. Esa acumulación es el telón de fondo de la ola de pedidos que ha llevado a los hiperescaladores a movimientos como el de Amazon, que triplicó su compromiso con NVIDIA hasta dos millones de GPU.

Perspectivas

Conviene seguir dos cambios. Más de la mitad de quienes presentaron en v6.1 usaron el nuevo arnés centrado en API de MLCommons, la base de MLPerf Endpoints, que según el consorcio reemplazará a Inference en los benchmarks de centro de datos. Y las cifras de Vera Rubin seguirán siendo provisionales hasta que la plataforma pase de vista previa a la categoría de disponible, donde los competidores podrán medirse contra ella en igualdad de condiciones. Hasta entonces, la lectura honesta de un 3,7x en vista previa es una dirección de marcha, no una decisión de compra; y el 1,6x que llegó en una actualización de software es la parte que ya está sobre la mesa.

FAQ — Preguntas frecuentes

¿Se puede comprar ya el Vera Rubin NVL72?

Todavía no. Se presentó en la categoría de vista previa de MLPerf, que MLCommons reserva para sistemas que no están disponibles de forma general en el momento de la presentación. Esos resultados sí pasan revisión por pares, pero no son directamente comparables con los de la categoría de disponibles, que los clientes ya pueden desplegar.

¿La cifra de 3,7x se aplica a todas las cargas de trabajo?

No. Es el mejor caso en Qwen3-VL entre los escenarios offline, servidor e interactivo. En DeepSeek-R1, con TensorRT-LLM en lugar de vLLM con Dynamo, la ganancia frente al GB300 NVL72 llegó hasta 2,5x. NVIDIA solo presentó resultados de Vera Rubin en esos dos benchmarks.

¿Qué hay de nuevo en MLPerf Inference v6.1?

Se sumaron dos benchmarks: una prueba RAG de extremo a extremo que cubre toda la tubería de recuperación y generación, y una prueba Edge Agentic Inference para programación agéntica multiturno en dispositivos edge. La ronda también añadió soporte de decodificación especulativa en el escenario interactivo para varias tareas.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista
AI & Machine Learning

Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista

SPINE, un nuevo benchmark publicado en arXiv, discute con los modelos hasta 25 turnos. En los siete sistemas evaluados, la tasa de claudicación sube con la longitud de la conversación.

Seung Junghace 7 días
GPT-6-Astra hizo trampa en 18 de 20 ejecuciones de una evaluación de alineamiento rehecha
AI & Machine Learning

GPT-6-Astra hizo trampa en 18 de 20 ejecuciones de una evaluación de alineamiento rehecha

Año y medio después de que Palisade Research destapara a los modelos que reescribían el tablero antes que perder, un nuevo señuelo muestra que la conducta solo se mudó de sitio.

Seung Junghace 7 días
Una IA descifró una clave de 373 años. Luego alguien revisó el microfilm
AI & Machine Learning

Una IA descifró una clave de 373 años. Luego alguien revisó el microfilm

Vals AI reportó que Claude Fable 5.1 resolvió en 44 minutos un criptograma de 373 años. Una réplica independiente sostiene que solo coinciden 8 de 64 letras.

Seung Junghace 7 días
Astra triplicó el beneficio de Claude en Vending-Bench y se negó a coludir
AI & Machine Learning

Astra triplicó el beneficio de Claude en Vending-Bench y se negó a coludir

Por primera vez desde que existe el benchmark, el modelo que más dinero gana con una expendedora simulada es también el que se niega a hacer trampa.

Seung Junghace 7 días
DeepSeek-V4.1-Flash reduce la caché KV a 890 bytes por token
AI & Machine Learning

DeepSeek-V4.1-Flash reduce la caché KV a 890 bytes por token

El nuevo MoE multimodal de 552.000 millones de parámetros de DeepSeek comprime la caché KV global a 890 bytes por token, cerca de una cuarta parte de su antecesor, y llega a Hugging Face con licencia MIT.

Seung Junghace 4 días
Salesforce entrenó su propio modelo de razonamiento sobre Nvidia Nemotron y se quedó con los pesos
AI & Machine Learning

Salesforce entrenó su propio modelo de razonamiento sobre Nvidia Nemotron y se quedó con los pesos

Salesforce presentó Koa en Dreamforce: un modelo de razonamiento para CRM entrenado a partir de Nvidia Nemotron 3 Super con datos sintéticos y alojado en su propia infraestructura.

Seung Junghace 5 días