BookinglyTech News
Inteligencia artificial

China Telecom publica Xing4.0-29B-A4B, un MoE de 29B entrenado en Ascend

El operador estatal chino libera los pesos de un modelo de mezcla de expertos con 4.000 millones de parámetros activos y 256K de contexto, entrenado de principio a fin en NPUs Ascend con MindSpore.

2 min de lecturaPandaily0 vistas

China Telecom AI ha publicado Xing4.0-29B-A4B, un modelo de lenguaje con arquitectura de mezcla de expertos (MoE): 29.000 millones de parámetros totales y 4.000 millones activos por token. Los pesos están abiertos y se descargan desde Hugging Face y ModelScope. Lo que separa este lanzamiento de la avalancha semanal de modelos abiertos es dónde se entrenó: de principio a fin en NPUs Ascend con MindSpore, el stack de Huawei, sin GPUs de Nvidia por medio.

Qué trae y qué no

El modelo admite 256K tokens de contexto y el anuncio lo enmarca como agentic, es decir, orientado a tareas con llamadas a herramientas y varios pasos encadenados. La cifra que importa para operarlo es la de parámetros activos: en un MoE solo se enciende una parte de los expertos en cada token, así que el coste de inferencia y la memoria en runtime se parecen más a los de un modelo de 4B que a los de uno de 29B. Eso no significa que quepa en cualquier sitio: los pesos completos siguen estando ahí y hay que cargarlos.

Más allá de eso, el material difundido es escaso. No hay cifras de benchmarks, ni desglose del dataset de entrenamiento, ni detalle claro de la licencia con la que se liberan los pesos. Tampoco se ha enseñado una demo ni un endpoint público para probarlo. Quedan por ver, por tanto, las dos cosas que deciden si alguien lo adopta de verdad: qué rendimiento saca frente a modelos abiertos de tamaño comparable y qué permite hacer la licencia con él en producción.

Por qué está en Ascend

MindSpore es el framework de Huawei y Ascend su familia de aceleradores. El ecosistema CANN lleva años intentando ser la alternativa doméstica a CUDA, empujado por las restricciones a la exportación de chips avanzados a China. Que un operador de telecomunicaciones estatal entrene de punta a punta en ese stack y suelte los pesos es una prueba de que la pila se puede usar desde fuera de sus creadores, no solo dentro de Huawei.

Ese es el interés real de la pieza para quien administra infraestructura: el entrenamiento end-to-end fuera de CUDA deja de ser un experimento de laboratorio y empieza a aparecer en publicaciones con pesos descargables. Si los números acompañan cuando salgan, la conversación dejará de ser sobre si se puede entrenar sin Nvidia y pasará a ser sobre a qué coste y con qué herramientas se opera el resultado.