BookinglyTech News
Inteligencia artificial

Dos utilidades en Python automatizan ROCm e inferencia local en GPUs AMD

ROCmFix resuelve los overrides de HSA_OVERRIDE_GFX_VERSION y InferBench compara backends midiendo tokens por segundo y tiempo hasta el primer token.

2 min de lecturaDev.to0 vistas

Un desarrollador ha publicado en GitHub dos utilidades en Python que atacan dos de los obstáculos con los que se topa quien intenta mover modelos de lenguaje en local sobre una GPU AMD: los overrides manuales de HSA_OVERRIDE_GFX_VERSION cuando el driver no reconoce la arquitectura, y la duda de si conviene tirar del backend Vulkan o del de ROCm/HIP para rascar más tokens por segundo. Ninguna de las dos viene de AMD: son herramientas de un tercero.

ROCmFix

El primero, ROCmFix, es un único archivo Python pensado para quitar de en medio el ajuste a mano. Consulta los identificadores PCI directamente, leyendo el registro de Windows o lspci en Linux, y a partir de ahí fija la variable de entorno correspondiente, ya sea para la sesión actual o de forma permanente. Cubre CMD, PowerShell, Bash, Zsh y Fish.

Trae además un subcomando de diagnóstico, rocmfix doctor, que inspecciona el SDK de HIP instalado y los componentes de Vulkan presentes en el sistema. Arrancarlo es lo mínimo:

python rocmfix.py

Para quien haya peleado con variables de entorno en Windows para que Ollama o LM Studio vieran una GPU que el driver se empeñaba en ignorar, el ahorro es evidente.

InferBench

El segundo, InferBench, responde a la otra pregunta: qué backend rinde más. Automatiza pruebas de velocidad de inferencia sobre distintos motores y, según el autor, cuida dos detalles que suelen contaminar estas mediciones. Primero lanza consultas de calentamiento antes de cronometrar. Después fuerza la descarga de la VRAM entre ejecuciones, de modo que una tanda no se beneficie de la caché ni de la fragmentación de memoria que dejó la anterior.

El resultado que reporta es la mediana de tokens por segundo y el tiempo hasta el primer token, que es la métrica que de verdad nota quien teclea un prompt y espera.

Lo que falta

No hay cifras publicadas en la nota, ni comparativas con otros métodos, ni validación de un tercero: lo que se describe es el flujo de trabajo que implementa la herramienta, no un resultado medido. Tampoco se detalla qué versiones de ROCm o de HIP soporta cada utilidad, algo que importa si se despliega en un parque de máquinas heterogéneo.

Merece la pena probarlas si se administra un taller con GPUs AMD y modelos locales. Si ROCm acaba detectando por su cuenta las arquitecturas que hoy obligan al override, ROCmFix perderá sentido, pero InferBench seguirá teniendo trabajo mientras convivan varios backends sobre el mismo silicio.