La decodificación especulativa salta de generación: EAGLE-3, DFlash y XPress
Cinco papers, un marco de co-diseño de NVIDIA y el primer benchmark serio del sector en 72 horas. La técnica que ataca el cuello de botella de memoria en inferencia cambia de arquitectura.

Un modelo de 70B parámetros sobre 8×H100 está limitado por el ancho de banda de memoria mientras decodifica, no por el cómputo: cada token generado obliga a releer unos 140 GB de pesos desde HBM3. La decodificación especulativa (SD) es la solución más probada en producción a ese atasco, y en las 72 horas previas al 3 de septiembre ha concentrado cinco papers en arXiv, un marco de co-diseño de NVIDIA y el primer estándar de benchmark serio del ramo. La arquitectura, además, ha cambiado de generación: de EAGLE-3 a DFlash, y de ahí a XPress.
El atasco que no se mueve
Con batch de 1, un Llama 3.3 70B sobre 8×H100 se queda en 15-20 tokens por segundo, y no porque las GPU estén ocupadas: están paradas en torno al 90% del tiempo esperando a memoria. La SD usa un modelo borrador pequeño que propone D tokens y un modelo objetivo grande que los verifica en un único forward pass por lotes. En teoría el resultado es sin pérdida, y en la práctica se mide con tres números: longitud de aceptación (AL, cuántos tokens del borrador se aceptan por verificación), coste relativo del borrador (ρ) y la D elegida. Todo cabe en una fórmula: el speedup se aproxima a (1+AL)/(1+ρ·D).
EAGLE-3, DFlash y la inyección de KV
EAGLE-3 fue el estado del arte hasta mediados de 2026. Usa una sola capa decoder transformer que toma el último hidden state del modelo objetivo y genera los tokens del borrador en serie. El problema es evidente: con D=11 son once forward passes consecutivos antes de poder verificar nada, con toda la sincronización host-dispositivo que eso arrastra.
Sobre un Qwen3-4B con borrador de cinco capas (datos de LMSYS, Z Lab y Modal de junio de 2026), EAGLE-3 daba AL de 4,2 y 2,1x en GSM8K, 4,3 y 2,2x en HumanEval, y 3,1 y 1,4x en MT-Bench.
DFlash, del mismo grupo, ataca el problema desde el diseño. Primero, genera el bloque completo de D tokens en un único forward pass paralelo, con un objetivo de difusión enmascarada: la GPU ve un GEMM grande limitado por cómputo en lugar de D pequeños limitados por memoria. Segundo, inyecta los hidden states del objetivo en la caché KV del borrador en todas las capas, no solo en la entrada. Con la misma AL que EAGLE-3, sale 3,3x en GSM8K (+57%), 3,2x en HumanEval (+45%) y 2,2x en MT-Bench (+57%). La ganancia viene entera de eficiencia de hardware.
XPress es la tercera generación, con refinamiento paralelo para los drafters de difusión.
Alrededor se han movido otras piezas en la misma semana: SPEED-Bench como primer benchmark del terreno, el overlap scheduler de SGLang Spec V2, el co-entrenamiento nativo de MTP frente a cabezas borrador post-entrenadas, y AceSpec para SD entre edge y nube sobre WAN de 50 Kbps. En la comunidad, r/LocalLLaMA está corriendo modelos de gama alta en hardware Mac; el hilo de Hacker News sobre Slotstream, un modelo de 125B a 12 tokens por segundo en un Mac de 48 GB, llegó a 226 puntos y 108 comentarios en una noche.
Lo que queda por ver no es solo el rendimiento. La paradoja de la tasa de aceptación y la reproducibilidad bit-exacta son los puntos donde un despliegue en producción se rompe, y elegir la D, el borrador y el backend no es un detalle de laboratorio: es una decisión de infraestructura con coste por token detrás.


