BookinglyTech News
Inteligencia artificial

Lemonade arregla el streaming en APUs de AMD y retira el backend ROCm de OpenMOSS

El servidor local de IA publica la RC 2026.40 con soporte de streaming en iGPU de AMD y elimina el backend ROCm de OpenMOSS por rendir unas 40 veces menos que Vulkan.

2 min de lecturaPhoronix0 vistas

El proyecto Lemonade, un servidor de IA local de código abierto alineado con AMD, ha publicado hoy la versión 2026.39.1 y una candidata de la 2026.40. Son las primeras entregas bajo su nuevo esquema de versionado, que pasa a combinar el año y el número de semana. La 2026.39.1 es la primera estable con este sistema y añade autoexpulsión configurable de vRAM, entre otros cambios menores.

Streaming en APUs y adiós al backend ROCm de OpenMOSS

La candidata 2026.40 corrige el soporte de modelos en streaming sobre GPU integradas de AMD. Hasta ahora Lemonade dimensionaba la memoria contra la ventana fija de vRAM reservada y no contra el pool GTT direccionable, lo que impedía arrancar modelos como DeepSeek-V4-Flash-IQ2XXS-DS4 en un Ryzen AI Max (Strix Halo) pese a haber RAM de sobra. El ajuste hace que se compruebe el GTT, algo que debería desbloquear más modelos en iGPU y APU del fabricante.

El otro movimiento llamativo es la retirada del backend ROCm de OpenMOSS, la iniciativa de investigación en IA y su ecosistema de modelos, en Windows y Linux. El motivo que han dado es de peso: esas rutas rinden alrededor de 40 veces menos que el backend Vulkan sobre el mismo hardware. Según el propio proyecto, el problema parece estar en caídas parciales a CPU dentro del código ROCm de OpenMOSS, lo que explicaría una diferencia tan grande. La petición de fusión elimina el soporte hasta que alguien lo arregle en condiciones, y de paso deja publicadas las cifras de rendimiento.

La RC incorpora además un nuevo agente de arranque para Junie, de JetBrains. Todo el detalle está en las notas de la versión.

Qué mirar antes de actualizar

Para quien despliegue inferencia local sobre hardware AMD, la corrección del GTT es lo importante: si tenías modelos en cuantizaciones agresivas que se negaban a cargar en Strix Halo teniendo memoria libre, esta es la versión que hay que probar. La retirada de OpenMOSS sobre ROCm no rompe nada que merezca la pena conservar, pero conviene revisar si alguna configuración apuntaba a ese backend: a partir de ahora toca Vulkan o volver a una versión anterior. El proyecto sigue manteniéndolo deshabilitado a la espera de que el rendimiento de ROCm en ese camino deje de ser el desastre que ellos mismos han documentado.