BookinglyTech News
Inteligencia artificial

Siete mecanismos de atención sobre un cuadrado latino: el orden da igual, la familia no

Un paper reparte siete mixers en una rejilla de 7×7 y los ablaciona uno a uno. Tres se pueden borrar sin coste medible; el único que sostiene la pila es el que no es atención.

3 min de lecturaDev.to0 vistas

Un equipo de VIDRAFT AI Research ha puesto a prueba una convención que casi nadie discute: que todas las capas de un transformer repitan el mismo mecanismo de atención. Su alternativa reparte siete mecanismos distintos en un cuadrado latino de 7×7 y los lee a lo largo de 49 capas. Las conclusiones útiles son dos, y ninguna es la del titular fácil: el orden en que los colocas da igual, y lo que de verdad sostiene la pila es tener al menos un mecanismo de una familia distinta.

El problema de medir esto

Si montas una pila heterogénea y gana a una uniforme, no sabes por qué. ¿Fue qué mecanismos usaste o dónde los pusiste? En la mayoría de papers sobre arquitecturas heterogéneas las dos variables van enredadas. El movimiento aquí es eliminar la segunda por construcción: un cuadrado latino es una rejilla N×N en la que cada símbolo aparece una vez por fila y por columna (un sudoku es un cuadrado latino con restricciones extra). Con siete mecanismos en una rejilla de 7×7 sobre 49 capas, ninguno puede agruparse por profundidad. No es que no lo hiciera en esa corrida: no puede, por construcción. Y ese equilibrio se consigue sin lanzar una búsqueda de arquitectura.

El modelo de referencia es Aether-7B-5Attn, un MoE de 6.590 millones de parámetros con unos 2.980 millones activos, 49 capas y siete mezcladores. Se entrenó con 16 B200 en FSDP de dos nodos, 162.000 pasos y 144.200 millones de tokens, unas 11.700 horas de B200. Eso no se ablaciona de ocho maneras con ocho semillas, así que la ablación se hace sobre un proxy de 700,9 millones de parámetros: cuatro mecanismos en una rejilla de 4×4 sobre dieciséis capas y ocho semillas por brazo.

Ahí sale el primer resultado práctico. Frente al brazo latin (entropía cruzada de 5,28639), la reordenación periodic queda en +0,16% y el brazo block en +0,59%; la pila homogénea, en +1,68%. Traducido: si tu calendario de mezcladores está repartido y equilibrado, la permutación concreta es ruido. Deja de quemar GPU buscando el orden de capas.

Lo que importa de verdad

Viene después la ablación interesante: quitar un mecanismo cada vez y recolocar los tres restantes. Ventana deslizante, −0,03%. Atención diferencial, −0,04%. Atención completa, +0,18%. Los tres son variantes del mismo operador. Mamba-2, un modelo de espacio de estados, es otra cosa: +2,14% y se va. Tres de los cuatro mecanismos pueden borrarse sin efecto medible, y el único que carga peso es el de familia distinta. Siete sabores de atención siguen siendo una pila homogénea a efectos de la pérdida.

A escala, la penalización crece: al pasar de 700,9 millones a 1.514 millones de parámetros (2,16×, tres semillas), la pila homogénea sube de +1,68% a +2,63% y quitar la familia SSM de +2,14% a +3,20%. Un efecto que se ensancha con el tamaño tiene más pinta de estructural que uno que se diluye. Lo que no se repitió: el eje de colocación se quedó en 700,9 millones, y nada se probó a siete mecanismos ni al tamaño del modelo grande. El paper lo admite en sus limitaciones.

Hay dos hábitos de método que se pueden copiar sin coste. El umbral de decisión, |Δ| > 2 desviaciones estándar agrupadas, se fijó antes de lanzar las últimas semillas; una corrida temprana de dos semillas separaba latin y periodic, que era la historia vendible, y cuatro semillas la disolvieron. Y en la auditoría de causalidad metieron un control positivo: 16 de 16 fallos inyectados a propósito se localizaron donde debían.

Para quien entrena modelos, la regla aplicable mañana es concreta: al mezclar operadores, asegúrate de que al menos uno venga de otra familia, y no pierdas semanas optimizando el orden. Queda por ver si el patrón aguanta en un modelo de producción y no solo en un piloto.