BookinglyTech News
Software

Alibaba lanza Qwen3.8‑Omni‑Flash con ventana de contexto de un millón de tokens y costes API reducidos

El nuevo modelo omnimodal de Alibaba expande el contexto a un millón de tokens y reduce los costes de entrada de audio y vídeo en más del 93%.

1 min de lecturaAlternativeTo0 vistas

Alibaba ha publicado Qwen3.8‑Omni‑Flash, un modelo nativo que admite texto, imágenes, audio y vídeo con una ventana de contexto de hasta 1 millón de tokens. El objetivo es manejar documentos extensos, conversaciones prolongadas y contenido audiovisual de larga duración, mejorando la recuperación de evidencia y la eficiencia de procesamiento.

Para tareas audiovisuales, el modelo genera descripciones controladas, extrae evidencia de grabaciones largas, razona entre secciones de vídeo, analiza reuniones y ayuda con tareas de seguimiento, además de producir informes de investigación centrados en vídeo. En la competencia OmniVideoBench, su puntuación subió de 63,4 a 67,8 respecto al predecesor, mientras el consumo de tokens cayó un 45,7 %, de 145 736 a 79 117.

Alibaba afirma que el coste de entrada de audio se redujo en un 98 %, y los costes de audio y visual bajaron más del 93 %. El rendimiento se mantiene cercano a Gemini 3.8 Flash en varias cargas de trabajo de largo contexto, aunque varía según el modo de inferencia.

El modelo está disponible a través de Qwen Chat en web y móvil, y los desarrolladores pueden acceder a él mediante DashScope con bibliotecas compatibles con la API de OpenAI. Qwen Chat

Importa a los equipos que manejan grandes volúmenes de datos multimodales: la reducción de tokens y costes puede traducirse en menores costos de infraestructura y mayor capacidad de análisis de contenido largo.