Lemonade 11.9 incorpora backend experimental HRX para Llama.cpp en GPUs AMD
La nueva versión 11.9 de Lemonade llega con soporte experimental de ROCm HRX, apuntando a un aumento de 30‑50 % en token/s en prefill para tarjetas Radeon RX 7900 y Strix Halo.
Lemonade 11.9 se ha lanzado hoy como la última actualización de este servidor de IA local, que sigue siendo 100 % libre y privado y funciona en Linux, Windows y macOS. La novedad más destacada es la integración experimental del backend HRX de ROCm con Llama.cpp, pensado inicialmente para las GPUs Radeon RX 7900 series (RDNA 3) y los APUs Strix Halo (RDNA 3.5).
HRX es parte de los esfuerzos Loom/Hyperloom anunciados por AMD en el evento Advancing AI en San Francisco. El proyecto sustituye al tradicional LLVM‑IR de ROCm por una capa de compilación propia, Loom IR, que promete generar código AMDGPU más rápidamente y con menor latencia. Según el repositorio hrx-system en GitHub, el sistema ofrece "una colección de componentes de runtime mínimos que proporcionan una alternativa a HIP y facilitan la integración de bajo nivel con GPUs, NPUs y CPUs de AMD".
El ingeniero de AMD Stella Laurenzo explicó en una discusión de GGML que HRX nace de la necesidad de contar con un backend nativo para cliente, ya que ROCm está orientado al datacenter y su adaptación a sistemas de escritorio presenta cuellos de botella. El objetivo es entregar un conjunto de librerías redistribuibles que, al menos en fase experimental, permiten ejecutar el modelo Qwen3‑Next (y el modelo de referencia unsloth/Qwen3‑30B‑A3B‑Instruct‑2507‑GGUF Q4_K_M) con un rendimiento superior. Las pruebas preliminares indican un incremento del 30‑50 % en token/s durante la fase de pre‑fill y alrededor del 10 % en tareas de decodificación sin MTP.
Lemonade 11.9 también actualiza su backend Llama.cpp estándar y agrega soporte para Qwen3‑Next, manteniendo la compatibilidad con CPUs, GPUs y NPUs. El soporte actual está limitado a los targets GFX1100 y GFX1151 bajo Linux, pero el proyecto promete ampliar la cobertura a más tarjetas y a otros sistemas operativos en próximas versiones.
Para los administradores que ya utilizan Lemonade en entornos de inferencia local, la llegada de HRX supone la posibilidad de exprimir más rendimiento de hardware AMD sin recurrir a soluciones propietarias de NVIDIA. Sin embargo, al estar en fase experimental, la estabilidad y el soporte a largo plazo siguen sin estar garantizados. Será clave monitorizar la evolución del repositorio HRX y los pull‑request de Llama.cpp para valorar si la mejora de rendimiento compensa el riesgo de depender de un backend aún no oficial.
En definitiva, Lemonade 11.9 abre la puerta a una integración más estrecha entre la pila de software de IA local y la arquitectura ROCm, lo que podría traducirse en despliegues más eficientes para quienes prefieren hardware AMD. Lo que queda por ver es si la comunidad adoptará rápidamente HRX y si AMD incorporará este stack en una versión estable de ROCm.