NVIDIA convierte los tokens por megavatio en la métrica, y Lambda le pone cifra

La primera validación en producción de DSX MaxLPS metió 19 nodos en un presupuesto eléctrico de 16 mientras las cargas con agentes reescriben el benchmark

|5 min de lectura0
NVIDIA is pitching AI data centres as power-constrained factories, where the figure that matters is how many tokens each megawatt produces.
NVIDIA is pitching AI data centres as power-constrained factories, where the figure that matters is how many tokens each megawatt produces.

Un operador que ya no puede conseguir otro megavatio de la compañía eléctrica solo tiene una palanca disponible: extraer más producción vendible de la potencia que ya tiene contratada. Sobre ese argumento construyó NVIDIA su conferencia inaugural en el AI Infra Summit esta semana, y llegó con una cifra de cliente para demostrar que la palanca funciona: Lambda metió 19 servidores en un presupuesto eléctrico reservado normalmente para 16, y a cambio obtuvo un 24% más de tokens por segundo del clúster.

Claves del anuncio

  • El despliegue de DSX MaxLPS en Lambda elevó el rendimiento de tokens del clúster de unos 4 millones a 5 millones por segundo y el rendimiento por vatio en un 23%, la primera validación en producción del software sobre servidores Blackwell.
  • NVIDIA reportó hasta 30 veces más rendimiento por megavatio y un coste por millón de tokens hasta 45 veces menor en Vera Rubin NVL72 frente a GB300 NVL72, medido sobre sesiones de programación con agentes reproducidas y no sobre peticiones aisladas.
  • En una demostración aparte con Emerald AI, una instalación de IA respondió a cientos de señales de demanda en tiempo real de una eléctrica municipal sin alterar los trabajos prioritarios.

Por qué cambia la vara de medir

Los FLOPS pico tenían sentido como señal de compra cuando el cuello de botella era el suministro de silicio. Lo tienen mucho menos en un edificio donde la cola de conexión a la red, y no la orden de compra, decide cuánto cómputo puede funcionar. El planteamiento de NVIDIA, expuesto por Ian Buck, su vicepresidente de computación hiperescalar y de alto rendimiento, en el anuncio del martes en la cumbre, es que los tokens de agente validados por megavatio son la cifra que de verdad se traduce en ingresos.

La comunidad de benchmarks avanza en la misma dirección. SemiAnalysis construyó AgentX a partir de sesiones reales de programación con agentes grabadas, conservando el crecimiento del contexto, la latencia de las llamadas a herramientas y la creación de subagentes en lugar de cronometrar peticiones aisladas. NVIDIA calcula que una sola de esas sesiones mueve unas 15 veces el volumen de tokens de una consulta de chat corriente, con longitudes de entrada y salida que varían mucho entre llamadas. No es una carga que una suite por petición describa bien, y por eso NVIDIA sitúa AgentX como complemento de las pruebas de inferencia de MLPerf y no como sustituto.

Con esa vara, las cifras de AgentX publicadas por NVIDIA para Vera Rubin NVL72 ejecutando DeepSeek V4 Pro alcanzan 30 veces el rendimiento por megavatio de la generación GB300 anterior, con un coste por millón de tokens hasta 45 veces menor. Ambos datos se presentan como techos, no como resultados habituales.

Qué demuestra el caso de Lambda

La pieza que hace el trabajo en Lambda es DSX MaxLPS. En lugar de dimensionar cada rack para su consumo en el peor caso y desperdiciar lo que no llega a usar, el software vigila el consumo de GPU y racks de forma continua y redirige el margen disponible hacia los trabajos que lo necesitan. El entrenamiento y el servicio de inferencia tienen perfiles eléctricos distintos, así que en una instalación mixta buena parte de ese margen queda ociosa por defecto.

Tres nodos adicionales dentro de la misma envolvente eléctrica suena modesto, pero se acumula a escala y no exige subestación, cableado ni permisos nuevos. NVIDIA espera que el margen se amplíe con su próxima generación: proyecta hasta un 40% más de capacidad de GPU y hasta un 35% más de rendimiento de tokens para instalaciones con Vera Rubin NVL72 bajo el mismo techo de megavatios. Para el trabajo con agentes limitado por latencia, la compañía también combina Vera Rubin con Groq 3 LPX, y afirma haber medido 2.529 tokens de salida por segundo y por usuario en una ejecución de Qwen 3.8 27B con 100K de contexto.

La red eléctrica pasa a formar parte de la arquitectura

La demostración de mayor recorrido tuvo poco que ver con los chips. A través del programa de conexión con carga flexible de Silicon Valley Power, Emerald AI mostró una instalación que reducía su consumo automáticamente en respuesta a señales de la eléctrica —cientos de ellas— mientras los trabajos críticos seguían en marcha. Emerald pretende construir su producto de gestión energética Conductor sobre NVIDIA DSX Flex, que lee peticiones de deslastre, eventos de respuesta a la demanda y cambios de precio, y actúa dentro de una jerarquía que el operador define de antemano.

El sentido del ejercicio es tan regulatorio como técnico. Las eléctricas racionan la capacidad de conexión dando por hecho que un centro de datos es un bloque de demanda inflexible; una instalación capaz de demostrar que cederá cuando se le pida llega a la cola con otro argumento. Ese planteamiento corre en paralelo a el capital que NVIDIA lleva movilizando para levantar fábricas de IA, y ataca la restricción que el dinero por sí solo no despeja.

Cuánto conviene fiarse de las cifras

Todos los múltiplos aquí proceden de un fabricante o un socio, medidos sobre cargas elegidas por ellos, y las comparaciones estrella enfrentan una generación con su predecesora inmediata. El dato de Lambda es la excepción que merece más peso: es un clúster en producción, las diferencias son lo bastante pequeñas como para resultar plausibles y otros operadores con Blackwell pueden comprobarlas. Las afirmaciones de 30x y 45x en AgentX están en un panel público, lo que al menos las hace rebatibles.

Las novedades con socios completaron el programa: Annapurna Labs, de Amazon, codesarrolla la memoria personalizada NVHBM; d-Matrix conecta sus XPU Raptor a CPU Vera mediante NVLink Fusion; y Pinterest ejecuta su búsqueda visual conversacional sobre Blackwell y Dynamo. Con NVIDIA asegurando que Vera Rubin está en producción plena, las mediciones independientes deberían llegar pronto para zanjar el resto.

Preguntas frecuentes

¿Qué son los tokens por megavatio?

Es el rendimiento normalizado por consumo eléctrico en vez de por número de chips o FLOPS pico. Donde el límite de expansión lo marca la conexión eléctrica y no el capital, indica al operador cuánta producción vendible genera cada megavatio contratado, una cifra más cercana a los ingresos que a una especificación de hardware.

¿Cuánto mejoró DSX MaxLPS el clúster de Lambda?

Lambda ejecutó 19 nodos en la envolvente eléctrica que suele asignarse a 16 nodos a plena potencia, lo que elevó el rendimiento de tokens del clúster alrededor de un 24%, de unos 4 millones a 5 millones por segundo, y el rendimiento por vatio un 23%. NVIDIA lo describe como la primera validación de MaxLPS en servidores Blackwell.

¿En qué se diferencia AgentX de MLPerf?

AgentX reproduce trayectorias completas de agentes, incluidas las llamadas a herramientas y la creación de subagentes, mientras que MLPerf Inference puntúa el rendimiento por petición en una amplia variedad de modelos y escenarios. NVIDIA presenta ambos como complementarios, porque responden a preguntas distintas sobre el mismo hardware.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Huang defiende el 70 % de crecimiento de Nvidia: "Ponemos un dólar y vuelven cien"
Tech & Business

Huang defiende el 70 % de crecimiento de Nvidia: "Ponemos un dólar y vuelven cien"

Huang ratificó la guía del 70 % de Nvidia, que implica 680.000 millones en ingresos, y respondió a las críticas de circularidad: un dólar entra, cien vuelven.

Seung Junghace 6 días
Un modelo de 30B superó a uno de 550B en la propia planificación fabril de Nvidia
Tech & Business

Un modelo de 30B superó a uno de 550B en la propia planificación fabril de Nvidia

Nvidia y Palantir publicaron una brecha de 86,7% frente a 55,5% a favor de un modelo de 30B ajustado sobre uno general de 550B en su propia asignación de materiales.

Seung Junghace 4 días
Nvidia gastó 27.000 millones de dólares sin presentar una sola notificación de fusión. El Departamento de Justicia quiere saber por qué
Tech & Business

Nvidia gastó 27.000 millones de dólares sin presentar una sola notificación de fusión. El Departamento de Justicia quiere saber por qué

Las autoridades antimonopolio abrieron el primer examen serio de la estructura que reemplazó a la adquisición en la industria de la IA: Nvidia recibió un requerimiento formal de información del Departamento de Justicia.

Seung Junghace 4 días
Temporal levanta 550 millones mientras los agentes de IA empiezan a ejecutarse durante semanas
Tech & Business

Temporal levanta 550 millones mientras los agentes de IA empiezan a ejecutarse durante semanas

Temporal Technologies levantó una Serie E de 550 millones de dólares con una valoración de 12.550 millones, coliderada por Lightspeed.

Seung Junganteayer
Universal Music firma con ElevenLabs su primer acuerdo con un gran sello para una plataforma de remezclas con licencia
Tech & Business

Universal Music firma con ElevenLabs su primer acuerdo con un gran sello para una plataforma de remezclas con licencia

UMG y ElevenLabs construirán una plataforma de consumo para remezclas y mezclas combinadas a partir de catálogo con licencia, el primer acuerdo de la empresa de audio con un gran sello.

Seung Junghace 5 días
Apple apuesta por la IA local con un Mac Studio de 512GB y el M5 Ultra
Tech & Business

Apple apuesta por la IA local con un Mac Studio de 512GB y el M5 Ultra

Apple presentó un Mac Studio con M5 Max y un nuevo M5 Ultra, y hasta 512GB de memoria unificada para quienes quieren ejecutar modelos grandes sin un centro de datos.

Seung Junghace 7 días