BookinglyTech News
Infraestructura

Huawei presenta OceanStor M900, un pool compartido de KV cache para SuperPoD

El fabricante chino anuncia almacenamiento para sus clústeres de IA con acceso NPU-SSD en un solo salto de 60 microsegundos, sin demo ni cifras de terceros.

2 min de lecturaPandaily0 vistas

En su conferencia anual HUAWEI CONNECT 2026, Huawei ha presentado el OceanStor M900 Context Memory Storage, un sistema de almacenamiento para sus SuperPoD —los clústeres de IA a gran escala de la compañía— que ofrece un pool compartido de KV cache a escala de petabytes. Las cifras que pone sobre la mesa son un acceso NPU-a-SSD en un solo salto de unos 60 microsegundos y un ancho de banda agregado de clúster de hasta 40 TB/s.

Para quien no siga el día a día de la inferencia: durante la generación de tokens, cada petición acumula una KV cache que crece con la longitud del contexto y con el número de peticiones simultáneas. Ese estado vive hoy en la memoria de la propia NPU, y cuando no cabe se tira o se recalcula. Sacarlo a un pool compartido, de forma que varios nodos puedan leer el mismo prefijo, cambia cuántas sesiones concurrentes aguanta un clúster y cuánto contexto se puede servir sin duplicar nada. El problema histórico es la latencia del camino hasta el SSD: si el salto cuesta más que recalcular, la operación no compensa.

Huawei no ha publicado más detalles. No hay demo, ni cifras de terceros, ni información sobre la interfaz que usa el M900 para hablar con las NPU, ni sobre compatibilidad con aceleradores de otros fabricantes, ni sobre disponibilidad o precio. Que los 60 microsegundos y los 40 TB/s salgan del propio fabricante es lo habitual en este tipo de anuncios, pero conviene tenerlo presente: son cifras de presentación, no de banco de pruebas independiente.

La jerarquía de memoria se ha convertido en el cuello de botella real de la inferencia a gran escala, y los fabricantes compiten por llevar la KV cache a almacenamiento rápido y compartido en lugar de dejarla encerrada en cada acelerador. Lo que queda por ver es la latencia sostenida con carga real y si la interfaz es estándar o queda atada a la pila propia de Huawei.