BookinglyTech News
Infraestructura

H3C cambia el foco de la IA: menos GPUs, más tokens útiles por GPU

El fabricante chino presenta en la conferencia Apsara su catálogo de infraestructura para agentes de IA con una tesis clara: apilar aceleradores ya no da rendimiento proporcional, y el cuello de botella se ha movido a la red, el almacenamie

3 min de lecturaTechNode0 vistas

Añadir GPUs ya no escala de forma proporcional y el problema ha dejado de ser de tarjetas para convertirse en un problema de sistema. Esa es la tesis con la que H3C ha presentado en la conferencia Apsara 2026 su catálogo de infraestructura para agentes de IA, que abarca desde el supercomputador hasta los conmutadores de interconexión y el almacenamiento. Zhu Shiyin, director general del departamento de investigación de tecnología avanzada de la compañía, lo resume así: cuando un clúster pasa de cientos a decenas de miles de aceleradores, la comunicación entre chips, la transferencia de datos, la planificación de tareas, la alimentación y la refrigeración pesan tanto como el propio cómputo.

Del SuperPod a la interconexión

El UniPoD S80000 admite configuraciones de 32 a 1.024 GPUs y puede crecer hasta 16.384, con soporte para recursos heterogéneos (CPU, GPU, NPU y DPU) y los frameworks habituales. La idea no es meter más silicio en un chasis, sino gestionar cómputo, red, almacenamiento, nube, seguridad y operaciones como un único sistema.

En interconexión, H3C cubre tres escenarios: dentro del nodo, entre nodos y entre centros de datos. Para el primero presenta el S9828-128EO, un conmutador de cómputo inteligente de 102,4T basado en óptica coempaquetada y fotónica de silicio que, según la empresa, recorta la latencia extremo a extremo un 15%. Entre nodos coloca el S9828-64FP, de 1,6T con SerDes de 224G, que baja el consumo más de un 20% en entornos de alta densidad. Y para el salto entre centros de datos, el S12500R-64EP, un conmutador DCI de 800G pensado para programar cómputo entre instalaciones de la misma ciudad y sincronizar gradientes.

El argumento de fondo es que la red deja de ser una cuestión de ancho de banda. A medida que el clúster crece, los protocolos, el control de congestión, la fiabilidad de los enlaces y el diagnóstico de fallos pesan igual. H3C avisa además de que los ecosistemas cerrados levantan silos nuevos, así que los protocolos abiertos y los estándares de la industria van a ganar importancia. Es una advertencia razonable viniendo de un fabricante que también vende su propia pila.

Almacenamiento y software

Las GPUs no funcionan sin datos. En entrenamiento, la preparación de conjuntos, el propio entrenamiento y el intercambio de parámetros mueven volúmenes enormes; en inferencia, la caché KV presiona a la vez almacenamiento y caché. El UniStor X20000, en su modelo X20836, declara hasta 200 GB/s y 3 millones de IOPS por nodo, con interoperabilidad en bloque, fichero, objeto y HDFS. Las cifras son de la compañía, no de un tercero: su motor reduciría un 30% el tiempo de espera de las GPUs y XCache recortaría hasta un 90% la latencia hasta el primer token en inferencia.

Con el hardware a cierta escala, el software pasa a ser el campo de batalla. Sistema operativo, bibliotecas de comunicación, solapamiento de cómputo y comunicación, planificación de tareas, balanceo dinámico de carga y gestión unificada de recursos son las palancas para bajar el tiempo muerto de las GPUs.

El cambio de métrica es lo relevante para quien firma compras o dimensiona un clúster: menos tarjetas contadas y más tokens útiles por segundo y coste por token. La pregunta que queda abierta es cuánto de esto se puede verificar fuera del escaparate de un fabricante.