BookinglyTech News
Infraestructura

NVIDIA Vera Rubin NVL72 lidera el rendimiento en MLPerf Inference v6.1

El nuevo sistema de NVIDIA entrega hasta 3,7 veces más throughput que su predecesor en benchmarks de IA, mientras mantiene una eficiencia de escala del 99 %.

2 min de lecturaNVIDIA Blog0 vistas

NVIDIA ha publicado los resultados de su sistema Vera Rubin NVL72 en la última versión de MLPerf Inference (v6.1). En la prueba de DeepSeek‑R1, el throughput alcanza un 2,5 veces la cifra de un GB300 NVL72; en Qwen3‑VL la diferencia crece a 3,7 veces.

El sistema se apoya en Tensor Cores mejorados y en la Engine de Transformers para acelerar tanto la fase de pre‑llenado como la de decodificación. La precisión NVFP4 reduce el tamaño de la memoria necesaria, manteniendo la calidad de salida.

La arquitectura de interconexión NVLink Switch, con tasas de paquetes 10 veces superiores y latencias 3 veces menores que el Ethernet convencional, permite que la técnica de “disaggregated serving” se extienda a escala de rack. Este enfoque separa pre‑fill y decode y habilita la paralelización de expertos para modelos con mezcla de expertos.

En cuanto a la eficiencia de escala, el GB300 NVL72 consiguió un 99 % de eficiencia al escalar de 72 a 288 GPUs en el escenario offline. La eficiencia se mantiene alta gracias a la red de alta velocidad entre racks y a una orquestación eficiente de peticiones.

El rendimiento de Vera Rubin también se refleja en benchmarks de IA agencial. En SemiAnalysis AgentX, el sistema superó al GB300 en 30 veces, indicando un potencial importante para cargas de trabajo de razonamiento.

NVIDIA continúa optimizando el software. Las mejoras entre la v6.0 y la v6.1 alcanzaron un 1,6 veces de rendimiento y siguen mejorándose después de la entrega.

Para las organizaciones que evalúan infraestructuras de inferencia, estos datos indican que Vera Rubin no solo genera más tokens por rack, sino que también reduce el costo por token gracias a la combinación de hardware y software codiseñado.

Más información sobre la mezcla de expertos se encuentra en el glosario de NVIDIA y Nebius también ha presentado resultados de Vera Rubin en su propio blog.