BookinglyTech News
Software

Pruning de LLMs como física: eliminar bloques con optimización Ising

Un nuevo enfoque transforma la eliminación de bloques en un problema de optimización binaria, logrando mejoras de rendimiento sin perder calidad.

2 min de lecturaHugging Face Blog0 vistas

Pruning de LLMs con una analogía física

El método propuesto elimina bloques completos de transformadores, reduciendo la profundidad del modelo y obteniendo aceleraciones de inferencia y ahorro de memoria. La cuestión es elegir los bloques correctos: quitar el bloque equivocado puede colapsar el modelo, y el impacto de cada bloque depende de los demás que se eliminen.

De un problema combinatorio a un Ising glass

La propuesta reformula la selección de bloques como un constrained binary optimization (CBO), equivalente a un Ising glass: cada bloque recibe una variable binaria (0=mantener, 1=eliminar). Se construye una matriz Hessiana aproximada mediante una expansión de Taylor de segundo orden de la pérdida del modelo. Los elementos diagonales indican la importancia individual; los fuera de diagonal son las interacciones entre bloques. El objetivo es minimizar la energía (x^{T}Hx) con la restricción de eliminar exactamente (M) bloques.

Proxy fiable para la calidad del modelo

El valor energético se correlaciona fuertemente con el rendimiento en benchmarks. Así, se pueden evaluar miles de configuraciones sin ejecutar el modelo completo, lo que reduce drásticamente el costo de búsqueda.

Escala y métodos de solución

Para modelos con pocas combinaciones, la búsqueda exhaustiva se realiza en GPU. Cuando el espacio de configuración crece (p.ej. 8 de 80 bloques en Llama‑3.3‑70B, ~29 billionas de combinaciones), se recurre a algoritmos de optimización Ising: quantum annealing, QAOA, búsqueda tabu y branch‑and‑bound. Un solver tabu de código abierto alcanza estados de mínima energía en segundos, incluso en los casos más duros.

Resultados concretos

En la compresión profunda del 50 % de Llama‑3.3‑70B‑Instruct, la técnica logra un aumento de casi 23 puntos porcentuales en MMLU respecto al mejor método de eliminación de bloques disponible.

Por qué importa

El enfoque ofrece una ruta práctica para reducir el tamaño de modelos gigantes sin sacrificar calidad, y se integra con cuantificación, compresión de rango bajo y otras técnicas. Los ingenieros de IA pueden usar la matriz Hessiana una sola vez y luego evaluar cualquier configuración de eliminación con un cálculo de energía.

Próximos pasos

La comunidad puede experimentar con el repositorio de GitHub para adaptar la técnica a otros modelos y explorar combinaciones híbridas con otras estrategias de compresión.

Repositorio en GitHub