BookinglyTech News
Infraestructura

Microsoft abre TauGrid, una plataforma para gestionar cargas de IA en Kubernetes

El proyecto empaqueta en una sola instalación de Helm la cola de trabajos, la orquestación, la salud de los nodos GPU y la observabilidad que hoy cada equipo monta por su cuenta.

3 min de lecturaInfoQ0 vistas

Microsoft ha publicado como código abierto TauGrid, una plataforma para programar, ejecutar y vigilar cargas de IA sobre clústeres de Kubernetes con GPU. No es un componente suelto: empaqueta en una única instalación de Helm las piezas que hoy cada equipo ensambla por su cuenta, y añade una CLI propia, tau, para enviar trabajos.

Quien haya levantado entrenamiento distribuido en Kubernetes conoce el trabajo que no se ve: scripts de envío, envoltorios de cola, comprobaciones de salud, recuperación de resultados y el pegamento entre todo ello. TauGrid apunta justo a ese hueco. Dentro lleva Kueue para la cola y la gestión de cuotas, KubeRay para la orquestación, monitorización de la salud de los nodos GPU y capacidades de observabilidad. En lugar de mantener cada pieza y su integración por separado, se despliega de una vez y con límites de responsabilidad definidos entre componentes.

La plataforma está pensada para dos públicos. Los equipos de plataforma manejan espacios de trabajo, colas, perfiles de cómputo, almacenamiento, identidad y observabilidad; los investigadores envían cargas sin tener que aprender Kubernetes. Microsoft dice que cubre el ciclo completo, desde la preparación de datos hasta el entrenamiento distribuido, el ajuste fino y la inferencia.

Cómo se envía un trabajo

La definición va en un fichero yaml y se lanza con tau run. El comando valida la configuración y crea un Job de Kubernetes o un RayJob de KubeRay, que Kueue encola según la cuota disponible y la prioridad. Durante la ejecución, TauGrid sigue el estado, los logs y los checkpoints, y guarda la evidencia del experimento para poder reproducirlo o diagnosticar un fallo más tarde. Si algo se cae, puede reanudar desde checkpoint.

Un ejemplo de configuración para un trabajo de entrenamiento con PyTorch sobre una sola A100:

schema_version: 1
name: aks-gpu-quickstart
run:
  entrypoint: train.py
  workload_kind: rayjob
compute:
  gpus: 1
  workers: 1
  cpus: 16
  memory: 64Gi
runtime:
  image: mcr.microsoft.com/aks/ai-runtime/ray:py3.12-ray2.56.0-cuda13.0
  pip:
    - torch>=2.4.0

Requisitos y lo que todavía falta

Para levantarlo hace falta un clúster de Kubernetes 1.30 o superior con nodos GPU, kubectl y Helm 3.0 o posterior. El código está escrito sobre todo en Go y el desarrollo se lleva dentro del ecosistema de Azure.

Microsoft reconoce que el proyecto está en marcha. Su hoja de ruta incluye espacios de trabajo multiinquilino, RBAC y cuotas, soporte para PyTorch DDP/FSDP, DeepSpeed y flujos con LoRA/QLoRA, gestión del ciclo de vida de los datasets y ejecución en varios clústeres y nubes. Es decir, buena parte de lo que una empresa necesita para producción todavía no está.

Tampoco es el único en su categoría. Kubeflow avanza hacia la graduación en la CNCF como sistema de aprendizaje automático maduro, y Nvidia comercializa Run:AI. La diferencia que vende Microsoft es la integración ya hecha: el repositorio está abierto, pero quien ya tenga Kueue y KubeRay funcionando tendrá que valorar si gana algo migrando a esta capa por encima. La compañía no ha enseñado ninguna demo, y las capacidades anunciadas son suyas, no de un tercero que las haya medido.