BookinglyTech News
Infraestructura

OpenLake lidera MLPerf Storage v3.0 en checkpointing de Llama 3.1 8B

El sistema de almacenamiento basado en io_uring y GPUDirect Storage logra el mayor ancho de banda de escritura y lectura en la división cerrada del benchmark.

2 min de lecturaShow HN0 vistas

MLCommons ha publicado los resultados de MLPerf Storage v3.0, el estándar de la industria para evaluar sistemas de almacenamiento bajo cargas de trabajo de entrenamiento e inferencia de IA. OpenLake se lleva el primer puesto en la división cerrada para la carga de checkpointing de Llama 3.1 8B, superando en ancho de banda de escritura y lectura a otras soluciones como NVIDIA AIStore y Nebius Object Storage.

Resultados medibles

La comparación se limita a cinco envíos con configuración idéntica: interfaz S3, un nodo cliente, una instancia de paralelo de datos y el modelo Llama 3.1 8B. OpenLake alcanzó 6,72 GiB/s en escritura y 11,55 GiB/s en lectura. Esto equivale a 1,98 veces el ancho de banda de escritura del siguiente competidor más rápido. En tiempo de respuesta, la escritura media fue de 29,42 segundos frente a los 37,24 segundos de Nebius, y la lectura de 9,37 segundos, el menor de la tabla.

El sistema evaluado utilizaba un nodo cliente conectado mediante InfiniBand a 400 Gb/s a un gateway NVMe de OpenLake. La arquitectura se apoya en el Infinity Core I/O Engine, que emplea I/O asíncrona mediante io_uring para operaciones de kernel no bloqueantes, hilos de ejecución fijos y coalescencia fina de E/S. También incluye ajustes específicos de XFS y una interfaz S3 para gestionar los checkpoints. Este diseño mantiene las operaciones de I/O activas mientras reduce la sobrecarga de programación y CPU, crítico cuando se deben aceptar escrituras paralelas eficientes y servir datos rápidamente durante la recuperación.

Por qué importa en clusters de GPU

En el entrenamiento de modelos a gran escala, los checkpoints pueden alcanzar cientos de gigabytes o varios terabytes. Si el almacenamiento es lento, los GPUs quedan parados mientras se salva el estado del modelo, o la recuperación tras un fallo se alarga innecesariamente. En clusters multimillonarios, cada segundo ahorrado en la escritura o lectura de checkpoints reduce el tiempo de inactividad de los aceleradores y abarata el coste total del entrenamiento. Esto es especialmente relevante para cargas de trabajo de preentrenamiento o refuerzo donde los checkpoints son frecuentes y una caída puede borrar mucho progreso.