BookinglyTech News
Inteligencia artificial

China Telecom publica Xing4.0-29B-A4B, un MoE entrenado solo con silicio chino

El modelo tiene 29.000 millones de parámetros totales y 4.000 millones activos, soporta 256K de contexto y, cuantizado a 4 bits, cabe en una RTX 4090.

2 min de lecturaITHome0 vistas

China Telecom ha liberado Xing4.0-29B-A4B, un modelo de lenguaje con arquitectura de mezcla de expertos: 29.000 millones de parámetros totales y 4.000 millones activos por token. La operadora lo presenta como el primer modelo de esa escala entrenado de principio a fin sobre aceleradores y frameworks chinos. Está publicado en Hugging Face y en un repositorio de GitHub, además de en ModelScope, Gitee y Modelers.

El dato de entrenamiento es el que sostiene el anuncio: chips Ascend para el entrenamiento, adaptación a frameworks nacionales y arquitectura propia. La afirmación es de la compañía y no viene acompañada de detalles sobre el clúster, los tokens consumidos ni el coste. Lo que sí se puede verificar es la compatibilidad, que es amplia y no depende de ese relato.

Contexto largo en una tarjeta de consumo

El modelo soporta 256K tokens de contexto de forma nativa, ampliables a 512K. Cuantizado a 4 bits, el peso en memoria baja hasta 15 GB, alrededor de un 75% menos que en FP16, lo que deja el despliegue al alcance de una RTX 3090 o una RTX 4090 con 24 GB. Para quien monta inferencia local, ese es el número que importa: no hace falta un nodo con varias A100 para probarlo con ventanas de contexto largas.

En el apartado de herramientas, la lista de integraciones es la habitual de un modelo que quiere entrar sin fricción en el ecosistema existente. Para ajuste fino admite LLaMA-Factory y MindFormers; para servir peticiones, SGLang, vLLM y KTransformers. Hay además adaptaciones específicas para frameworks de agentes como OpenCode, Claude Code, OpenClaw y Hermes, ajustadas a las convenciones de formato de cada uno.

El único dato de rendimiento que acompaña al lanzamiento es de SuperCLUE: 93,52 puntos en capacidades de agente, tercer puesto de la tabla, a menos de un punto de dos modelos Qwen que van por delante. Es una evaluación de referencia en China y la cifra la publica la propia organización del benchmark, pero conviene tomarla como lo que es: una foto de un conjunto de tareas, no una medida de comportamiento en producción.

Lo que queda por comprobar

El interés de la pieza no está tanto en el modelo como en la ruta que dibuja. Si un operador de telecomunicaciones puede entrenar y desplegar un MoE de 29.000 millones de parámetros sin salir del stack doméstico, el argumento de que el hardware alternativo solo sirve para inferencia se debilita. Faltan, eso sí, los números que permitirían comparar de verdad: rendimiento bruto en entrenamiento, consumo energético y estabilidad del toolchain.

Para el lector que quiera probarlo, el camino razonable es el de siempre en estos casos: descargar los pesos, levantarlo con vLLM o SGLang y medir con sus propias cargas antes de sustituir nada. Las evaluaciones de agente reportadas por terceros se parecen poco al tráfico real de una aplicación.