Ajustar un modelo de 8B con 250 ejemplos de seguridad mejora una parte y rompe otra
Un caso practico documenta que el fine-tuning de un modelo pequeno para clasificar amenazas mejora el campo categorico de la respuesta y degrada los campos que exigen composicion y matices.

Un desarrollador ha hecho fine-tuning de un modelo de 8B, unos 8.000 millones de parametros, para clasificar amenazas de seguridad con menos de 250 ejemplos y en hardware de consumo. El resultado no es ni un desastre uniforme ni una mejora limpia: dentro de una misma respuesta estructurada, el campo que asigna la categoria de amenaza mejoro tras el ajuste, mientras que los campos que exigen composicion —la puntuacion de severidad contra una rubrica de varios factores y el recuento de profundidad del ciclo de vida— quedaron por debajo de la linea base del modelo sin ajustar.
El propio autor se adelanta a la objecion: nada de esto es un fenomeno nuevo. El olvido catastrofico, ese que hace que ajustar un modelo en una tarea estrecha degrade lo que ya hacia bien, lleva anos documentado, y la literatura sobre ajuste supervisado ya describia perfiles de capacidad irregulares, con una habilidad que sube y las vecinas que bajan. El caso es un ejemplo concreto y medido, no un descubrimiento.
Dos fallos que se salen del guion
El mas llamativo es el que llama colapso de alcance. Una consulta fuera de dominio, una pregunta sobre el tiempo, no fue rechazada: el modelo la metio por el pipeline completo de analisis de seguridad porque su forma superficial encajaba con la de los ejemplos de entrenamiento. Pasa algo, se registra, se emite una recomendacion. No hubo comportamiento malicioso ni intento de manipulacion, y ahi esta la diferencia con los casos de misalignment emergente ya publicados: solo una frontera que el modelo deberia haber respetado y que se erosiono como efecto secundario de un ajuste estrecho y muy basado en plantillas.
El segundo es un colapso por repeticion en un ejemplo benigno. Entrenar con menos de 250 ejemplos para producir respuestas estructuradas y largas es el escenario de manual del sobreajuste: el paisaje de perdida se afila y pequenas variaciones durante la generacion producen salidas desproporcionadas.
Lo que aporta
El autor situa su caso frente a la literatura existente: el estudio que compara ajuste supervisado con tuning por refuerzo, el que mide la degradacion del razonamiento por ajuste, mas acusada en modelos pequenos, y el que ajusto varios modelos pequenos para preguntas de ciberseguridad y vio como se degradaba su conocimiento parametrico. Los articulos que cita estan en arXiv.
Lo aprovechable para quien despliegue clasificadores de salida estructurada es el metodo de evaluacion. Una nota global de precision habria escondido justo lo que paso aqui: una respuesta que acierta mas en el campo categorico y falla mas en los graduados. Medir campo por campo, y probar con entradas fuera de dominio que compartan la forma de los ejemplos de entrenamiento, es lo que separa un modelo ajustado que sirve de uno que solo parece funcionar.

