Los modelos basados en conteo siguen perdiendo contra los transformers en escalabilidad
Una experimentación con Pitman-Yor jerárquico completa la serie: la mejora al añadir datos se estanca mucho antes que en las redes neuronales.

Los modelos de lenguaje que no dependen de parámetros entrenados siguen sin lograr comportamiento similar a los LLM grandes. Un nuevo experimento con un modelo jerárquico Pitman-Yor completo confirma que la tasa de mejora al escalar los datos es mucho menor que en los transformers pequeños, cerrando la puerta a esta familia de métodos como sustituto neuronal.
El experimento y los resultados
El equipo investigó si un modelo no neuronal podía mantener un aumento constante en precisión a medida que duplica el corpus de entrenamiento. La métrica clave no es la puntuación absoluta, sino la pendiente de mejora: el ganancia en top-1 por cada duplicación de tokens entre 4M y 8M. En comparaciones previas, los modelos clásicos mostraban ganancias marginales (Witten-Bell +0.005, Kneser-Ney modificado +0.006) frente a +0.021 de un transformer pequeño. El nuevo modelo, que usa barridos de Gibbs e hiperparámetros inferidos por profundidad, mejora sobre las aproximaciones simples pero no cambia la tendencia general.
Con 2M de tokens, el nuevo modelo alcanza un top-1 in-distribution de 0.326 y una perplexidad de 36.8, superando a Kneser-Ney modificado (0.316 y 45.7). Sin embargo, la pendiente de mejora cae a +0.008 al pasar de 1M a 2M tokens, frente a los +0.006 de Kneser-Ney y los +0.010 de la versión simple. Esto demuestra que el problema no es la calidad del ajuste ni la estructura de las mesas en el algoritmo, sino una limitación inherente de los modelos basados en conteo para aprovechar datos adicionales.
Implicaciones para la ingeniería
El hallazgo más útil para quienes trabajan en sistemas de recomendación o búsqueda es la calibración. El nuevo modelo ofrece una reducción constante del 20% en perplexidad respecto a Kneser-Ney, lo que le permite ganar en mezclas con transformers. En una combinación ajustada, el componente basado en conteo logra un OOD top-1 de 0.175, superando al transformer solo (0.156) y a otras mezclas. Esto sugiere que, aunque no pueden competir solos en escalabilidad, siguen siendo útiles como componentes complementarios en arquitecturas híbridas.
El repositorio de investigación no es público, por lo que las cifras provienen del propio harness de pruebas del equipo. La conclusión es clara: si un método no neuronal quiere superar a los transformers, necesitará un tipo de estado completamente diferente, no una jerarquía de n-gramas mejor ajustada.

