BookinglyTech News
Inteligencia artificial

Alibaba lanza Qwen-Audio-3.1 y reduce la latencia de LiveTranslate

El nuevo paquete de audio de Alibaba incluye modelos ASR y TTS, así como una versión en tiempo real con latencia inferior.

2 min de lecturaPandaily0 vistas

Alibaba ha presentado en la conferencia Apsara 2026 la familia Qwen-Audio-3.1, un conjunto de modelos de inteligencia artificial especializados en procesamiento de audio. El anuncio incluye mejoras significativas en su herramienta de traducción simultánea, Qwen3.8-LiveTranslate, donde la latencia promedio ha bajado de 2,8 a 2,3 segundos.

Una suite completa para el audio

La novedad principal es el despliegue de Qwen-Audio-3.1, que abarca varias modalidades de interacción con la voz. La suite incluye modelos de reconocimiento automático de voz (ASR), síntesis de voz (TTS) y una variante en tiempo real (Realtime) diseñada para aplicaciones conversacionales. Además, se ha presentado TTS-Next, una rama enfocada en la generación de paisajes sonoros cinemáticos, lo que sugiere un interés en aplicaciones multimedia más allá de la simple dictada de texto.

Para los equipos de desarrollo, el dato más relevante es la reducción de la latencia en LiveTranslate. Aunque la cifra de 0,5 segundos adicionales de mejora puede parecer marginal en un entorno de laboratorio, en sistemas de traducción en vivo esta diferencia se traduce en una interacción más fluida y menos perceptible para el usuario final. Alibaba no ha detallado aún la arquitectura específica de la versión 3.1 ni los requisitos de cómputo exactos para despliegue local o en la nube.

El contexto es que la competencia en modelos de audio multimodal está intensificándose, con otros fabricantes buscando reducir el gap entre la percepción del habla humana y la respuesta de la máquina. La integración de ASR, TTS y traducción en una misma familia de modelos permite a los arquitectos de software construir pipelines de voz más coherentes, evitando la fragmentación entre proveedores distintos para cada etapa del proceso.

Queda por ver cómo rinden estos modelos en producción, especialmente la variante Realtime, que suele ser donde se aprecian más los cuellos de botella de infraestructura. Sería prudente esperar a las primeras benchmarks independientes antes de integrar la suite en sistemas críticos de atención al cliente o asistentes virtuales.