Alibaba libera los pesos de Qwen3.8-2.4T-A95B, un MoE de clase Max
El modelo de 2,4 billones de parámetros, con 95 mil millones activos, apunta a cargas agénticas con contexto largo.

El equipo de Qwen en Alibaba ha publicado los pesos abiertos de Qwen3.8-2.4T-A95B. Es el primer modelo de la familia 'Max' que se libera como open weights, siguiendo la estela de la estrategia de transparencia que la compañía ha ido ganando terreno en los últimos tiempos.
Arquitectura y rendimiento
El modelo es un MoE (Mixture of Experts) con 2.400 billones de parámetros totales, aunque solo 95.000 millones están activos por pasada. Esta arquitectura permite escalar el conocimiento sin disparar el coste de inferencia de forma lineal, un equilibrio clave para despliegues a gran escala.
La novedad técnica más relevante es la atención híbrida, diseñada específicamente para manejar contextos muy largos. El objetivo declarado es sacar el máximo partido a cargas de trabajo agénticas, donde los agentes necesitan mantener coherencia a lo largo de muchas interacciones o procesar documentos extensos sin perder el hilo.
Compatibilidad y despliegue
Para facilitar la adopción, Alibaba ha publicado recetas de inferencia contemporáneas para SageMaker HyperPod y vLLM. Esto significa que los administradores de sistemas pueden empezar a evaluar el modelo en sus pipelines de CI/CD o en clusters de Kubernetes sin tener que reinventar la rueda en la configuración de la cola de inferencia o la gestión de la memoria.
No se trata de un experimento de investigación, sino de un artefacto de producción. La disponibilidad de los pesos en formatos estándar permite a los equipos de TI probar el modelo en sus propios entornos, ajustando los parámetros de cuantización y comparando el rendimiento real contra los benchmarks teóricos.
La competencia en el segmento de modelos de gran escala con pesos abiertos se está tensando. Mientras otros actores se mantienen cerrados o liberan versiones reducidas, Alibaba está ofreciendo la punta de lanza de su gama de productos. Esto obliga a los arquitectos a reconsiderar sus decisiones de licencia y coste de cómputo: si el rendimiento en tareas agénticas de este 2.4T-A95B es competitivo, el argumento de vender acceso vía API pierde fuerza frente a la posibilidad de alojar el modelo en la propia nube privada o en un cluster dedicado.


