BookinglyTech News
Inteligencia artificial

Liquid AI publica un borrador especulativo para acelerar su VLM LFM2.5-VL-3B

El drafter añade 280 millones de parámetros al modelo de 3B y promete hasta 3,13x más velocidad de decodificación en dispositivo, sin tocar la calidad de salida.

3 min de lecturaHugging Face Blog0 vistas

Liquid AI ha publicado LFM2.5-VL-DSpark, un modelo borrador experimental que se acopla a su VLM LFM2.5-VL-3B para decodificar más rápido mediante decodificación especulativa. La compañía cifra la ganancia en hasta 3,13x en dispositivo y 2,66x en una H100, con latencias de extremo a extremo que mejoran hasta 2,62x y 2,27x. El borrador añade 280 millones de parámetros, un 8,9% sobre el modelo objetivo, y no altera la salida: el modelo grande verifica cada token propuesto, así que la generación greedy es idéntica a la de LFM2.5-VL-3B en solitario.

Llega con soporte el primer día en llama.cpp, MLX-VLM y SGLang. Los pesos están en Hugging Face en formatos Safetensors y GGUF, y la licencia es de pesos abiertos: se pueden descargar, ajustar y desplegar sin restricciones.

Un borrador de cuatro capas

El drafter usa la misma arquitectura que los LFM2.5-DSpark de texto. Engancha los hidden states del modelo objetivo en un conjunto fijo de capas y los usa como condición para proponer un bloque de k tokens candidatos. Los parches de imagen y los tokens de texto se proyectan antes a una representación compartida, de modo que el borrador trabaja siempre sobre vectores de la misma dimensionalidad, venga la entrada de una imagen o de texto. El algoritmo de inferencia, por tanto, no cambia respecto a los modelos de texto.

Liquid AI probó variantes de 3, 4 y 5 capas y se quedó con un drafter de solo atención, 4 capas y bloque de 9, entrenado 10 épocas sobre una mezcla de datos SFT de visión y lenguaje ponderada hacia los casos de uso previstos. Del total de 279,5 millones de parámetros, 193,0M son la pila decodificadora, 21,0M la proyección de hidden states y 65,5M una cabeza de Markov; normas y cabeza de confianza suman 6,4k. En inferencia recomiendan bloques de 8 o 9 según el hardware.

Qué se gana en cada máquina

Las cifras las mide la propia Liquid AI y dependen del backend. Con MLX sobre un M5 Max, la decodificación va de 2,30x a 3,13x más rápida según la tarea y la latencia total mejora entre 1,56x y 2,62x. Con llama.cpp sobre un M3 Ultra, la decodificación sube entre 1,57x y 2,14x y el extremo a extremo entre 1,30x y 1,77x. En una H100 la decodificación llega hasta 2,66x y el extremo a extremo se mueve entre 1,64x y 2,27x. Las pruebas cubren seis tareas de visión, entre ellas VQA general, VQA de texto en imagen, descripción de imágenes, gráficos, razonamiento complejo y conversación multiturno, siguiendo el benchmark MMSpec.

El techo de la técnica

La decodificación especulativa solo acelera la decodificación. No toca el codificador de visión ni el prefill, y en un VLM ambos pesan: la imagen pasa por un encoder y después el backbone de lenguaje procesa cientos de tokens visuales junto al prompt. En dispositivos de borde, con mucha menos potencia que una GPU de centro de datos, el prefill se come una porción mayor del tiempo total, así que un salto grande en decodificación puede quedarse en una mejora modesta de extremo a extremo. Es la ley de Amdahl: el límite lo pone la parte que no se acelera. Los aceleradores neuronales por núcleo del M5 estrechan esa distancia, según la compañía.

Las cifras son del fabricante, no de una medición independiente, y el rendimiento final depende del backend y del equipo. Lo que sí queda claro es el encaje: un VLM de 3B que corre en un portátil con pesos abiertos, borrador intercambiable y las integraciones ya enviadas en lugar de prometidas, más los PR correspondientes para SGLang, llama.cpp y MLX-VLM que quien quiera probarlo tendrá que compilar.