Pruning de LLMs como física: eliminar bloques con optimización Ising
Un nuevo enfoque transforma la eliminación de bloques en un problema de optimización binaria, logrando mejoras de rendimiento sin perder calidad.

Pruning de LLMs con una analogía física
El método propuesto elimina bloques completos de transformadores, reduciendo la profundidad del modelo y obteniendo aceleraciones de inferencia y ahorro de memoria. La cuestión es elegir los bloques correctos: quitar el bloque equivocado puede colapsar el modelo, y el impacto de cada bloque depende de los demás que se eliminen.
De un problema combinatorio a un Ising glass
La propuesta reformula la selección de bloques como un constrained binary optimization (CBO), equivalente a un Ising glass: cada bloque recibe una variable binaria (0=mantener, 1=eliminar). Se construye una matriz Hessiana aproximada mediante una expansión de Taylor de segundo orden de la pérdida del modelo. Los elementos diagonales indican la importancia individual; los fuera de diagonal son las interacciones entre bloques. El objetivo es minimizar la energía (x^{T}Hx) con la restricción de eliminar exactamente (M) bloques.
Proxy fiable para la calidad del modelo
El valor energético se correlaciona fuertemente con el rendimiento en benchmarks. Así, se pueden evaluar miles de configuraciones sin ejecutar el modelo completo, lo que reduce drásticamente el costo de búsqueda.
Escala y métodos de solución
Para modelos con pocas combinaciones, la búsqueda exhaustiva se realiza en GPU. Cuando el espacio de configuración crece (p.ej. 8 de 80 bloques en Llama‑3.3‑70B, ~29 billionas de combinaciones), se recurre a algoritmos de optimización Ising: quantum annealing, QAOA, búsqueda tabu y branch‑and‑bound. Un solver tabu de código abierto alcanza estados de mínima energía en segundos, incluso en los casos más duros.
Resultados concretos
En la compresión profunda del 50 % de Llama‑3.3‑70B‑Instruct, la técnica logra un aumento de casi 23 puntos porcentuales en MMLU respecto al mejor método de eliminación de bloques disponible.
Por qué importa
El enfoque ofrece una ruta práctica para reducir el tamaño de modelos gigantes sin sacrificar calidad, y se integra con cuantificación, compresión de rango bajo y otras técnicas. Los ingenieros de IA pueden usar la matriz Hessiana una sola vez y luego evaluar cualquier configuración de eliminación con un cálculo de energía.
Próximos pasos
La comunidad puede experimentar con el repositorio de GitHub para adaptar la técnica a otros modelos y explorar combinaciones híbridas con otras estrategias de compresión.