Alibaba lanza Qwen3.8‑Omni‑Flash con ventana de contexto de un millón de tokens y costes API reducidos
El nuevo modelo omnimodal de Alibaba expande el contexto a un millón de tokens y reduce los costes de entrada de audio y vídeo en más del 93%.

Alibaba ha publicado Qwen3.8‑Omni‑Flash, un modelo nativo que admite texto, imágenes, audio y vídeo con una ventana de contexto de hasta 1 millón de tokens. El objetivo es manejar documentos extensos, conversaciones prolongadas y contenido audiovisual de larga duración, mejorando la recuperación de evidencia y la eficiencia de procesamiento.
Para tareas audiovisuales, el modelo genera descripciones controladas, extrae evidencia de grabaciones largas, razona entre secciones de vídeo, analiza reuniones y ayuda con tareas de seguimiento, además de producir informes de investigación centrados en vídeo. En la competencia OmniVideoBench, su puntuación subió de 63,4 a 67,8 respecto al predecesor, mientras el consumo de tokens cayó un 45,7 %, de 145 736 a 79 117.
Alibaba afirma que el coste de entrada de audio se redujo en un 98 %, y los costes de audio y visual bajaron más del 93 %. El rendimiento se mantiene cercano a Gemini 3.8 Flash en varias cargas de trabajo de largo contexto, aunque varía según el modo de inferencia.
El modelo está disponible a través de Qwen Chat en web y móvil, y los desarrolladores pueden acceder a él mediante DashScope con bibliotecas compatibles con la API de OpenAI. Qwen Chat
Importa a los equipos que manejan grandes volúmenes de datos multimodales: la reducción de tokens y costes puede traducirse en menores costos de infraestructura y mayor capacidad de análisis de contenido largo.

