BookinglyTech News
Inteligencia artificial

Entrenar más mueve el cruce frente a una caché sin parámetros, pero a un precio

Un análisis mide la tasa: para igualar a una tabla de conteo en un archivo de 4.000 tokens hacen falta entre 10 y 20 veces más código del mismo dominio.

3 min de lecturaDev.to0 vistas

Un transformer pequeño acaba perdiendo contra una tabla de conteo que se limita a leer el documento que tiene delante, y la respuesta de manual —entrenar más— es correcta en dirección pero débil en magnitud. Un análisis mide ese «más» en forma de tasa: cada duplicación de datos de entrenamiento solo mueve el punto de cruce 1,6 veces en longitud de documento. Igualar a la caché en un archivo de 4.000 tokens exigiría entre 10 y 20 veces más código del mismo dominio del que suman CPython y PyTorch juntos.

Cómo se midió sin entrenar nada

El dato sale de reevaluar checkpoints que ya existían. El experimento anterior había guardado tres modelos de 2,45 millones de parámetros con idéntica arquitectura, entrenados con 500.000, 2 y 8 millones de tokens de código, así que aquí no hay entrenamiento nuevo. La caché no usa datos de entrenamiento, de modo que su precisión es constante en todo el barrido: es el control interno del montaje, y de hecho apenas se mueve, de 0,311 a 0,313 en L=250 y de 0,487 a 0,487 en L=4000 entre filas.

Hay una arruga que podía romper la comparación en silencio. Cada checkpoint construyó su propio vocabulario de 16K, y solo el 39,8% de los vocabularios de 500.000 y 8 millones se solapan. Cada celda se codifica con el vocabulario del checkpoint que prueba, y el modelo de conteo usa los mismos tokens que vio el transformer. Las comparaciones son dentro de una escala; lo único que cruza es la posición del cruce.

El valor medido es el delta emparejado, caché menos transformer, así que positivo significa que gana el mecanismo sin parámetros. Los cruces: unos 74 tokens de documento con 500.000 tokens de entrenamiento, unos 155 con 2 millones, unos 492 con 8 millones. Dieciséis veces más datos movieron el cruce 6,6 veces. Extrapolando —ejercicio ilustrativo, no medido—, competir en 1.000 tokens pediría unos 23 millones de tokens; en 4.000, unos 174 millones (22x); en 16.000, unos 1.300 millones (167x). Solo con el tramo de 2 a 8 millones, menos subentrenado, la tasa sube a 1,78 por duplicación y L=4000 baja a unos 97 millones, 12x.

Por qué la tasa es tan pobre

Son dos pendientes sin relación. Los datos elevan la línea plana del transformer, pero no le dan acceso al documento: una ventana de 64 tokens no ve un archivo de 4.000 por mucho texto que haya leído. La ganancia por datos es casi igual a cualquier longitud (+0,132 en L=250, +0,170 en L=4000). Y el número tiene su gracia: 16 veces más corpus llevan al transformer de 0,219 a 0,389 en L=4000; que la caché lea 4.000 tokens en vez de 250 sobre el mismo archivo la lleva de 0,313 a 0,487. Recolectar 16 veces más datos rinde más o menos lo mismo que dejar que un mecanismo sin parámetros siga leyendo el fichero que ya tiene abierto.

De propina, con 8 millones de tokens y L=250 la tabla de conteo saca 0,415 frente a 0,370 del transformer, lo que replica en otro harness el hallazgo previo de que contar gana al transformer pequeño en código. Sumado a los números de corpus-más-caché de un experimento vecino, de 0,461 a 0,551 en este rango, el modelo entrenado no supera a los componentes gratuitos en ninguna longitud; solo se justifica como componente de una mezcla, con un peso de unos 0,2.

Queda sin tocar la mitad más seria: parámetros y ventana de contexto están confundidos en toda esta línea. Todo aquí varía los datos con una ventana fija de 64 tokens, y la ventaja de la caché es enteramente ver texto que el transformer no ve. Un modelo con ventana de 4.096 tokens leería el documento él mismo. Hasta que se haga ese experimento, el resumen correcto es estrecho: con contexto corto fijo, comprar acceso al documento sale mucho más barato que comprar datos de entrenamiento.