Qwen publica Flash-Next, un MoE de 125.000 millones con solo 6.000 activos por token
Alibaba libera los pesos de un modelo de mezcla de expertos ultradisperso: 125.000 millones de parametros totales y unos 6.000 activos por token, como anticipo de la arquitectura Qwen4.

Alibaba ha publicado Qwen3.8-Flash-Next, un modelo de mezcla de expertos con 125.000 millones de parametros totales de los que solo unos 6.000 millones se activan por token. Los pesos estan abiertos, y la compania lo describe como un anticipo de la arquitectura sobre la que construira la familia Qwen4, el mismo guion que ya uso en generaciones anteriores.
El modelo salio el 26 de agosto con pesos disponibles en Hugging Face y en GitHub, incluida una variante en FP8. Es multimodal (texto, imagen y video) y admite 262.144 tokens de contexto nativo, ampliables a un millon con escalado tipo YaRN.
La cifra que a primera vista suena contradictoria, ese "125B con 6B activos", es justo la propuesta: el computo por token se parece al de un modelo pequeno mientras el conocimiento almacenado se parece al de uno grande. La tabla de embeddings de N-gramas anade otros 51.000 millones de parametros que se consultan, no se multiplican, y por eso pueden vivir en memoria del host y precargarse de forma asincrona.
Por que sale mas barato por token
Qwen atribuye el ahorro a cuatro cambios. Las capas de Gated DeltaNet comprimen el historial en un estado de tamano fijo en tiempo lineal; Qwen Sparse Attention usa un indexador ligero para atender solo a los micro-bloques de contexto que importan. El coste de la atencion completa crece de forma cuadratica con la longitud de secuencia, y este hibrido en gran medida no. A eso se suman el Gated Residual, que ensancha el flujo residual en cuatro ramas con compuertas dinamicas, y un entrenamiento con una version refinada del optimizador Muon, con la ley de escalado reajustada.
La compania cifra el coste de entrenamiento en aproximadamente una novena parte del de Qwen3.7-Plus, con mejores resultados en codigo y tareas de oficina. Es una cifra suya, no replicada por terceros.
Frente al 27B denso
Los dos modelos son hermanos, no sustitutos. Qwen3.8-27B es denso: sus 27.000 millones de parametros se activan en cada token y cuantizado cabe en 17-19 GB de VRAM, una sola GPU de consumo. Flash-Next cambia esa simplicidad por escala con activacion baja. Necesita 128 GB de Mac o configuraciones multi-GPU con offload, y montarlo implica servir un MoE. En SWE-bench Pro el proveedor da 62.5 para Flash-Next y 61.7 para el denso: poca diferencia en ese benchmark, mucha en economia de contexto largo.
El millon de tokens cambia lo que significa dar contexto. Lo que antes exigia un pipeline de RAG, con troceado, embeddings y ranking, puede ser un unico prompt contra el corpus crudo: un trimestre entero de transcripciones de ventas, o una cartera completa de contratos para preguntar por clausulas concretas. Un matiz que conviene no perder: un prompt de un millon de tokens no es gratis aunque solo active 6.000 millones de parametros. El procesamiento sigue costando computo; la atencion dispersa rebaja la curva, no la borra.
Quien tenga un agente de largo recorrido sobre volumenes grandes de documentos tiene aqui algo que probar contra su propio harness. Quien quiera un asistente de codigo fiable en una GPU de consumo sigue mejor con el denso, al menos por ahora.

