Alibaba lanza Qwen3.8-Omni-Flash, su modelo omni-modal con 1M de contexto
El modelo acepta texto, imagen, audio y vídeo, recorta el precio de la API de audio por encima del 98% y estrena una variante en tiempo real.

Alibaba ha puesto en circulación Qwen3.8-Omni-Flash, la nueva generación de su modelo nativo omni-modal, ya disponible en la plataforma de Qwen. Acepta texto, imagen, audio y vídeo en la misma entrada y mantiene un contexto de un millón de tokens. La compañía sostiene que la capacidad multimodal sube de forma apreciable frente a la generación anterior sin sacrificar lo que ya daba en texto.
El salto lo mide contra Qwen3.5-Omni-Plus. En una batería de 30 evaluaciones, la media mejora más de un 26%. Los números que más se mueven están en tareas de agente sobre audio y vídeo: WildClawBench-MM sube 36,5 puntos, AgenticVBench 22,3 y UniClawBench se queda en 69,6. En audio largo, LongAudioSpan gana 8,3 puntos y OmniVideoBench 9,6. En OmniCap-IF, las métricas CSR e ISR suben 8,5 y 14,1. El dato más llamativo es AliMeeting: el DER y el cpWER pasan de 88,11/89,61 a 3,35/17,18, esto es, de un sistema que apenas separaba hablantes a uno que los distingue.
Todo esto es lo que dice Alibaba. No hay evaluación de terceros, y la comparación con Gemini 3.8 Flash —donde afirman estar cerca en vídeo y por delante en audio— sale también de su propio laboratorio.
Precio y agentes
El recorte de precio es la parte que más afecta a quien tenga que operar esto: la entrada de audio por hora cae más de un 98% en la API, y la de audio más vídeo, más de un 93%. Para flujos con horas de grabación, ese es el número que decide si el caso de uso sale a cuenta.
En comprensión de vídeo largo con enfoque de agente, la precisión en OmniVideoBench sube de 63,4 a 67,8 mientras el consumo de tokens baja de 145.736 a 79.117, un 45,7% menos. En reuniones admite hasta una hora de audio y vídeo, con separación de hablantes, transcripción, asignación de identidad, acta, tareas pendientes y análisis de riesgos; con llamadas a herramientas puede enviar correos o encargar código.
Alibaba ha ampliado Qwen-MM-Plugins y ha liberado Qwen-Live Harness, orientado a interacción continua en tiempo real. Dentro de esos plugins está Video2Note, que convierte horas de vídeo en notas PDF con imágenes asociadas, y Omni Skill Creator, que extrae procedimientos de una demostración y los transforma en habilidades reutilizables.
Tiempo real
La variante Qwen3.8-Omni-Flash-Realtime percibe y responde mientras entra el flujo, y puede llamar a herramientas con el contexto en curso. La empresa afirma que es el primer modelo omni-modal que localiza la fuente de un sonido combinando audio espacial y visión, con dirección y distancia. También admite inyección de identidad, estilo y reglas de negocio.
Hay un detalle que dice bastante del enfoque: en un experimento, el modelo pasó 12 horas intentando mejorar el reconocimiento de sichuanés de Qwen2.5-Omni-3B. Eligió su propio conjunto de evaluación, hizo cuatro rondas y construyó 3.413 muestras de entrenamiento; el error de carácter bajó del 25,79% al 15,30%, una caída relativa del 40,7%.
Queda por comprobar lo de siempre: si esos números aguantan fuera del laboratorio y cómo se comporta la API en producción, con las cifras de latencia y throughput que la compañía ha publicado junto al anuncio.


