BookinglyTech News
Inteligencia artificial

Dos LoRA de temas distintos mejoran su dominio, pero el intercambio sigue ahi

Un experimento con adaptadores especializados en guitarras y en masa madre muestra que cada uno gana en su tema sin volver mejor al modelo en todo lo demas.

2 min de lecturaDev.to0 vistas

Dos adaptadores LoRA entrenados sobre temas distintos mejoran la perplejidad en su propio dominio, y el intercambio entre ambos sigue siendo visible en los conjuntos de evaluacion reservados. El resultado viene de una unica ejecucion de entrenamiento y evaluacion, hecha por el autor del experimento y publicada con sus propias cifras.

El montaje es pequeno: un modelo base y dos especialistas, uno para guitarras y otro para masa madre. Cada adaptador se mide contra los dos conjuntos reservados. La tabla queda asi:

guitarra masa madre
base 18,2 19,4
lora-guitar 11,3 15,4
lora-sourdough 13,7 12,2

Cada adaptador gana donde deberia. El detalle esta en la otra columna: el especialista en guitarras tambien mejora la perplejidad de masa madre respecto al base, de 19,4 a 15,4, pero se queda lejos del 12,2 que consigue el adaptador entrenado para ese tema. El de masa madre hace lo simetrico. Eso es una afirmacion mas estrecha que decir que los adaptadores mejoran el modelo: mejoran la metrica del tema medido, y la especializacion no desaparece al resumir la tabla.

No basta con la perplejidad

La ejecucion no se acepto solo por esos numeros. Una verificacion independiente registro 4 de 4 decisiones de seguridad correctas y 14 de 14 casos adversariales de operador resueltos. Tambien comprobo que no habia solapamiento exacto de texto entre entrenamiento y conjunto reservado, ni solapamiento exacto de JSON entre esos datos y los adversariales. Los tres hashes de los conjuntos de datos y los dos de los adaptadores quedan en el artefacto de verificacion, de modo que las entradas y las salidas se pueden comprobar sin fiarse de la tabla.

Hay una nota operativa que el autor decide mantener. Otros procesos ocupaban la GPU y quedaba poca VRAM libre, lo que produjo avisos del asignador de memoria de CUDA. El entrenamiento y la evaluacion terminaron igualmente con codigo de salida 0 y los dos adaptadores generados en tiempo de ejecucion estaban presentes. El razonamiento es razonable: un final en verde no convierte un entorno con recursos justos en uno holgado, y el aviso documenta en que condiciones se obtuvo el resultado.

Lo util aqui es precisamente lo modesto del hallazgo. Los adaptadores mueven las puntuaciones reservadas en la direccion esperada, las comprobaciones de seguridad y adversariales pasan, y el intercambio entre especialistas no se diluye. Queda por ver si el patron se sostiene con otros pares de temas, con mas de una ejecucion y con un modelo base distinto, que es donde una tabla de tres filas deja de bastar.