BookinglyTech News
Inteligencia artificial

Qwen 3.8 27B: un GGUF de 17 GB iguala a GPT-5.6 Luna en el índice de Artificial Analysis

Alibaba publica los pesos abiertos de un modelo de 27.000 millones de parámetros que, según sus cifras, alcanza a los frontera en la nube y se ejecuta en local a coste cero por token.

3 min de lecturaDev.to0 vistas

El equipo Qwen de Alibaba subió el 15 y 16 de agosto los pesos de Qwen 3.8 27B a Hugging Face, en un GGUF Q4_K_M de 17 GB que ya corre en MacBook Pro con M5, en estaciones con DGX Spark y en equipos de escritorio. Puntúa 52 en el índice de inteligencia de Artificial Analysis, el mismo número que GPT-5.6 Luna con el razonamiento en su nivel máximo, con 27.000 millones de parámetros y coste cero por millón de tokens al ejecutarlo en local.

El resto de la tabla ayuda a dimensionarlo. GLM-5.2 saca 53 con 753.000 millones de parámetros, y DeepSeek V4 Pro 0813 el mismo 53 con 1,6 billones; ambos viven en la nube, a 0,02 y 0,06 dólares por millón de tokens el primero y 0,01 y 0,03 el segundo. Anthropic Opus 4.6 Max se queda en 49 y Meta Muse Glimmer-30B en 46. GPT-5.6 Luna cobra 0,40 dólares de entrada y 1,60 de salida por millón. La versión anterior, Qwen 3.6 27B, se quedaba en 44.

Hay una trampa que la propia publicación deja a la vista: el modelo generó 160 millones de tokens durante la batería de pruebas, frente a una mediana de 43 millones. Eso apunta a que el modo de razonamiento xhigh venía activado por defecto, lo que infla a la vez la calidad y el cómputo. Las cifras son del fabricante, no de un tercero independiente, y nadie ha enseñado todavía una comparativa externa.

Atención lineal con puerta

El modelo tiene 64 capas repartidas en 16 macrobloques de cuatro. Tres de cada cuatro capas usan Gated DeltaNet, atención lineal que mantiene un estado de memoria de tamaño fijo en lugar de hacer crecer la KV cache con cada token, con una puerta de olvido aprendida que decide qué se actualiza en cada paso. La cuarta capa es GQA clásica, con 24 cabezas de consulta y 4 de clave-valor, y se encarga del recuerdo preciso dentro del contexto, justo donde la atención lineal flojea. Ese 3:1 es la apuesta: el 75% de las capas pasa a coste lineal y la caché deja de explotar con secuencias largas. El contexto nativo es de 262.144 tokens, ampliable a un millón con scaling, y el vocabulario llega a 248.320 entradas.

Control del razonamiento

En la API aparece reasoning_effort, con niveles que ajustan cuánto piensa el modelo antes de responder, y preserve_thinking, pensado para reutilizar el bloque de razonamiento y no recalcularlo en conversaciones de varios turnos. Las cabezas de Multi-Token Prediction hacen de decodificador especulativo incorporado: las pruebas que acompañan a la publicación hablan de un 72% más de tokens por segundo en llama.cpp. También hay visión nativa, con cajas delimitadoras y vídeo, y un ejemplo de agente de código ejecutándose en local.

Para quien despliega infraestructura, la pregunta no es si un 27B empata con un frontera alojado, sino qué cambia cuando el modelo vive en la máquina: sin coste por token, sin datos saliendo del portátil y sin cuota que negociar con un proveedor. Lo que falta por comprobar es cuánto ocupa realmente la KV cache con un millón de tokens de contexto, cómo se comporta esa cuantización Q4 en tareas largas y si el 52 se sostiene con el nivel de razonamiento por defecto en lugar del máximo.