Shanghai AI Lab y la SJTU liberan NCP-ArchPreview, un modelo latente de 8.900 millones
El modelo entrena a la vez la predicción del siguiente concepto y la del siguiente token, y sus autores dicen igualar la pérdida de un baseline de 7B en el 51,3% de los tokens.

El Laboratorio de Inteligencia Artificial de Shanghái y el LUMIA Lab de la Universidad Jiao Tong de Shanghái han abierto el código de NCP-ArchPreview, un modelo de 8.900 millones de parámetros que opera en espacio latente. Lo singular es el objetivo de entrenamiento: no solo predice el siguiente token, como casi todo el mundo, sino que entrena en paralelo la predicción del siguiente concepto. Según los autores, iguala la pérdida de un baseline de 7B en aproximadamente el 51,3% de los tokens.
Qué cambia y qué no
La predicción de tokens es el pan de cada día desde GPT-2. Añadir un objetivo sobre conceptos apunta a que la red aprenda regularidades por encima de la secuencia superficial, sin depender tanto de la forma exacta en que se escriben las cosas. La idea no es nueva del todo, pero verla en un modelo abierto de casi nueve mil millones de parámetros le da a quien entrena modelos un punto de comparación que antes solo existía en papers.
El dato de rendimiento hay que leerlo con calma. Igualar la pérdida de un baseline de 7B en la mitad de los tokens, con 1.900 millones de parámetros más, no es un golpe sobre la mesa: es un empate parcial. La cifra la dan los propios autores y no viene acompañada, en lo que se ha hecho público, de benchmarks de downstream, ni de comparación con modelos del mismo tamaño.
El anuncio es escueto. No menciona licencia, ni datos de entrenamiento, ni dónde queda el repositorio, ni si los pesos están disponibles para descarga. Para un equipo que esté decidiendo si dedicar GPUs a probar el enfoque, esos tres detalles pesan más que la arquitectura en sí: sin licencia clara y sin pesos, un modelo abierto solo es abierto de nombre.
Queda por ver si el repositorio aparece con pesos y licencia, y sobre todo si el entrenamiento conjunto escala. Si el objetivo de concepto ayuda en modelos pequeños pero se diluye al crecer, la línea de trabajo se quedará en anécdota de laboratorio. Si aguanta, es una vía barata de mejorar la eficiencia de datos sin tocar el tamaño de la red.

