Un solo desarrollador logra ejecutar CUDA sobre una Radeon en Windows
El proyecto CUDA-for-AMD-Windows enlaza ZLUDA con el SDK HIP/ROCm mediante scripts de PowerShell y entrena una red de refuerzo con bibliotecas CUDA sin modificar sobre una RX 9060 XT.

Un desarrollador ha publicado CUDA-for-AMD-Windows, un conjunto de scripts de PowerShell que enlaza ZLUDA con el SDK HIP/ROCm de AMD en Windows y permite ejecutar cargas de trabajo que exigen CUDA sobre una GPU Radeon. El autor lo ha probado entrenando de principio a fin una red de refuerzo PPO de 2,2 millones de parámetros con bibliotecas CUDA sin modificar, sobre una RX 9060 XT, la única GPU que soporta por ahora.
El proyecto no es un runtime nuevo. Es una automatizacion reproducible: detecta la arquitectura de la GPU, descarga una version fijada de ZLUDA (v6-preview.69) y la conecta con las bibliotecas matematicas de ROCm que ya estan presentes en Windows. Con eso consigue interceptar la API del driver de CUDA y redirigir cuBLAS, cuSPARSE y cuFFT a sus equivalentes de AMD. Lo que no resuelve todavia es cuDNN, justo la pieza de la que dependen muchos frameworks.
Lo que dicen los numeros
El repositorio incluye un A/B controlado. Con la ruta oficial (ZLUDA publico y HIP SDK 6.4 de stock), la carga de refuerzo da una mediana de 13.278,46 steps por segundo. La ruta alternativa, montada con binarios antiguos de ZLUDA recuperados, se queda en 12.875,80, un 3,03% menos; la media cae un 3,97%. En tiempo de inferencia la diferencia va en contra del overlay: 0,6293 s frente a 0,5863 s, un 7,33% mas. El propio autor apunta que una reescritura posterior elimino LibTorch/ZLUDA del PPO y consiguio bastante mas rendimiento, asi que la capa de traduccion se paga.
El contexto y las trampas
AMD ya lleva PyTorch y el SDK HIP oficiales a Windows para las RX 7000 y RX 9000, de modo que lo nativo esta cubierto. El problema es todo lo demas: aplicaciones propietarias, repositorios antiguos y herramientas de IA que dan por hecho que debajo hay una NVIDIA. Hasta ahora eso se resolvia con WSL2, con arranque dual o esperando a que alguien portara a HIP.
Las limitaciones son las que cabria esperar de un proyecto de una sola persona. No resuelven cuDNN, TensorRT ni NCCL, asi que la compatibilidad depende por completo de que bibliotecas toque la herramienta en cuestion. Y ZLUDA perdio su respaldo comercial por segunda vez y se mantiene como proyecto de fin de semana. Esto es utilidad para trastear, no una estrategia de despliegue corporativa.
Aun asi, deja un dato claro: la barrera para correr software exclusivo de CUDA sobre AMD no parece un problema de hardware, sino de capas de traduccion. Con mas gente mirando el codigo, la deteccion de hardware y los parches para resolver mas bibliotecas podrian ampliarse.

