OpenLake lidera MLPerf Storage v3.0 en checkpointing de Llama 3.1 8B
El sistema de almacenamiento basado en io_uring y GPUDirect Storage logra el mayor ancho de banda de escritura y lectura en la división cerrada del benchmark.
MLCommons ha publicado los resultados de MLPerf Storage v3.0, el estándar de la industria para evaluar sistemas de almacenamiento bajo cargas de trabajo de entrenamiento e inferencia de IA. OpenLake se lleva el primer puesto en la división cerrada para la carga de checkpointing de Llama 3.1 8B, superando en ancho de banda de escritura y lectura a otras soluciones como NVIDIA AIStore y Nebius Object Storage.
Resultados medibles
La comparación se limita a cinco envíos con configuración idéntica: interfaz S3, un nodo cliente, una instancia de paralelo de datos y el modelo Llama 3.1 8B. OpenLake alcanzó 6,72 GiB/s en escritura y 11,55 GiB/s en lectura. Esto equivale a 1,98 veces el ancho de banda de escritura del siguiente competidor más rápido. En tiempo de respuesta, la escritura media fue de 29,42 segundos frente a los 37,24 segundos de Nebius, y la lectura de 9,37 segundos, el menor de la tabla.
El sistema evaluado utilizaba un nodo cliente conectado mediante InfiniBand a 400 Gb/s a un gateway NVMe de OpenLake. La arquitectura se apoya en el Infinity Core I/O Engine, que emplea I/O asíncrona mediante io_uring para operaciones de kernel no bloqueantes, hilos de ejecución fijos y coalescencia fina de E/S. También incluye ajustes específicos de XFS y una interfaz S3 para gestionar los checkpoints. Este diseño mantiene las operaciones de I/O activas mientras reduce la sobrecarga de programación y CPU, crítico cuando se deben aceptar escrituras paralelas eficientes y servir datos rápidamente durante la recuperación.
Por qué importa en clusters de GPU
En el entrenamiento de modelos a gran escala, los checkpoints pueden alcanzar cientos de gigabytes o varios terabytes. Si el almacenamiento es lento, los GPUs quedan parados mientras se salva el estado del modelo, o la recuperación tras un fallo se alarga innecesariamente. En clusters multimillonarios, cada segundo ahorrado en la escritura o lectura de checkpoints reduce el tiempo de inactividad de los aceleradores y abarata el coste total del entrenamiento. Esto es especialmente relevante para cargas de trabajo de preentrenamiento o refuerzo donde los checkpoints son frecuentes y una caída puede borrar mucho progreso.


