Kubernetes refuerza el almacenamiento y se enfrenta al coste real de la inferencia
Kubernetes v1.37 estrena dos controles de almacenamiento en Alpha, China Merchants Bank sube la utilización de sus 10.000 aceleradores y WEKA avisa: la factura por token sigue sin resolverse.

Kubernetes v1.37 ha empezado a distribuir en estado Alpha dos funciones de seguridad de almacenamiento: opciones de bind mount y control de permisos para volúmenes emptyDir. La versión suma 67 mejoras en total. Y llega la misma semana en que el ecosistema discute si el modelo de recursos del orquestador aguanta una tarea que no se parece a un contenedor: pagar la inferencia de un modelo por token.
noexec, nodev y nosuid desde el manifiesto
Nispriha Jagan y Neeraj Krishna, de Red Hat, firman la entrada en el blog del proyecto. Los emptyDir son uno de los tipos de volumen escribible más usados y llevan tiempo acumulando hallazgos de seguridad. Las opciones nuevas se apoyan en mecanismos de bajo nivel de Linux y permiten aplicar noexec, nodev y nosuid a los montajes. En palabras de los autores, eso da a los usuarios una forma nativa de endurecer los volúmenes y alinearlos con estándares y políticas de seguridad, sin depender de apaños externos.
De 35% a más del 60% de utilización
China Merchants Bank enseñó su infraestructura de IA cloud native en un evento de la CNCF en China y se llevó el End User Case Study Contest. La arquitectura combina Kubernetes con Kueue para colas y cuotas, KEDA para autoescalado por eventos, Prometheus para métricas, HAMi para repartir aceleradores entre cargas de trabajo y Fluid para acelerar el acceso a los datasets. El banco maneja cerca de 10.000 tarjetas aceleradoras, y no todas iguales: son heterogéneas. Con ese stack unificó el 99% de sus recursos de cómputo para IA, subió la utilización media del 35% a más del 60% y recortó un 60% el coste de procesar un millón de tokens en condiciones comparables. Son cifras de la entidad, no de una auditoría independiente.
KubeCon + CloudNativeCon Norteamérica 2026, en Salt Lake City del 9 al 12 de noviembre, tendrá por primera vez un itinerario de inferencia de IA y sistemas agénticos, con MCP, A2A y pasarelas de IA en el programa. Gartner publicó su cuadrante mágico de virtualización de servidores y colocó a HPE como Challenger junto a Canonical y Oracle. HPE patrocina la serie de boletines en la que se anunció su posición, un detalle que conviene tener presente al leer el entusiasmo. Weave Intelligence encuestó a 242 responsables de ingeniería de plataformas: un 38% de los equipos entrega al menos el doble que antes de meter IA agéntica en el ciclo, un 20% reporta mejoras de eficiencia y un 11%, ahorro operativo.
El caso del banco deja claro que hay margen, pero no resuelve la pregunta de fondo. Val Bercovici, jefe de IA de WEKA, sostiene que el coste por token depende de un estado que Kubernetes nunca se diseñó para gestionar: la mezcla de peticiones, la ocupación de la caché KV, el equilibrio entre prefill y decode y cómo se consume memoria y ancho de banda dentro del acelerador cuando el pod ya está corriendo. «Mi opinión es que Kubernetes no desaparece», dice, «pero si su modelo de recursos no evoluciona, se convierte en un impuesto sobre la economía de la inferencia». Lo que espera es una capa nueva de planificación y memoria alrededor del orquestador, capaz de calcular lo que cuesta servir cada token. Hasta entonces, la utilización se puede mejorar; la contabilidad fina, no.


