BookinglyTech News
Software

Janes Street publica estudio sobre la ponderación de secuencias en modelos de lenguaje

El análisis revela un comportamiento no lineal del peso efectivo de las secuencias a medida que los modelos crecen, pasando de patrones independientes a dependientes del peso y luego de nuevo a independientes.

2 min de lecturaLobsters0 vistas

A Janes Street se ha publicado una investigación que explora cómo varía el efecto del peso asignado a cada secuencia de entrenamiento cuando se escalan los modelos de lenguaje. Los autores definen el exponente de peso efectivo de la secuencia como la potencia con la que el peso de una secuencia se relaciona con la reducción de pérdida que produce el modelo.\n\nEl experimento se realizó con dos familias internas de LLMs, de 10 m a 500 b millones de parámetros, y con la familia Qwen 2.5 de 0,5 b a 72 b. Se asignaron pesos aleatorios a cada secuencia, se entrenó el modelo y luego se evaluó la pérdida sobre el mismo corpus para medir la respuesta del modelo a los pesos.\n\nLos resultados muestran un patrón no monótono: en modelos pequeños, el exponente tiende a 0, lo que indica que el modelo aprende patrones globales sin importar el peso. Cuando el modelo pasa a la escala media, el exponente sube, alcanzando valores cercanos a 1, lo que significa que el modelo aprende en proporción al peso de cada secuencia. Finalmente, en los modelos grandes el exponente vuelve a bajar hacia 0, sugiriendo que el modelo logra capturar todos los patrones presentes independientemente del peso.\n\nEsta dinámica se ha observado también en estudios anteriores, como el Chinchilla scaling [https://arxiv.org/abs/2203.15556], que muestra cómo los hiperparámetros se mantienen estables a escala, y el reporte técnico MAI‑Thinking‑1 [https://microsoft.ai/pdf/mai-thinking-1.pdf], donde la relación entre calidad de datos y tamaño del modelo se invierte al crecer la arquitectura.\n\nEl estudio destaca que la extrapolación de hiperparámetros basados en modelos pequeños a escalas mayores puede fallar cuando el comportamiento de ponderación es anómalo. La aparición de exponente elevado en la escala media sugiere que la mezcla de datos debe ajustarse con cuidado, especialmente cuando se prioriza calidad o dominios específicos como OCaml.\n\nPara los ingenieros que gestionan pipelines de entrenamiento, la lección es clara: no basta con fijar pesos estáticos; es necesario medir cómo evolucionan los efectos de ponderación con el tamaño del modelo y evitar suposiciones lineales que pueden llevar a una asignación subóptima de recursos y FLOPs.\n\nEl artículo completo y los comentarios de la comunidad se encuentran en Lobsters [https://lobste.rs/s/tamvz4/study_sequence_weighting_at_scale].