Alibaba lanza Qwen Audio 3.1: cinco modelos de voz y rebajas de hasta el 95 %
El equipo Qwen publica una familia de cinco modelos para reconocimiento, síntesis y conversación en tiempo real, y recorta el precio de su API de audio hasta un 95 %.

El equipo Qwen de Alibaba ha publicado Qwen-Audio-3.1, una familia de cinco modelos que cubre reconocimiento de voz (ASR), síntesis de voz (TTS) e interacción en tiempo real. El lanzamiento viene acompañado de una bajada de precios en su API de audio: hasta un 95 % en ASR, alrededor del 85 % en el modelo en tiempo real y un 70 % en TTS.
Qué hace cada modelo
El modelo ASR mejora el reconocimiento multilingüe y de dialectos, y limpia por su cuenta muletillas y repeticiones en la transcripción. Su variante ASR-Next añade identificación de varios hablantes con marcas de tiempo, además de detección de emociones, sonidos ambiente y ruido de maquinaria.
En el lado de la síntesis, TTS hace generación multilingüe con transferencia de voz entre idiomas, es decir, mantiene el timbre de una voz al cambiar de lengua. El control de emoción, velocidad y estilo se hace con instrucciones en texto. El original pone este ejemplo:
Read this with a sharp, commanding tone, demanding respect.
TTS-Next va por otro camino: combina un modelo de lenguaje con un enfoque de difusión para producir voz, efectos de sonido y audio de fondo en una sola pasada, sin encadenar varias etapas.
El modelo en tiempo real soporta hablar y escuchar a la vez, con interrupción instantánea. Según Qwen, si detecta un estado de ánimo bajo responde más despacio y con más empatía.
Dónde duele el recorte
La bajada más agresiva está en ASR, el modelo que más se usa en producción para transcribir. Un 95 % menos en ese endpoint cambia la cuenta de cualquier pipeline que procese audio en volumen: transcripciones de reuniones, subtitulado, análisis de llamadas o indexado de archivos de voz. Realtime, con su 85 %, apunta a agentes conversacionales, donde el coste por minuto de conversación es la variable que decide si un producto sale o no.
Los detalles técnicos y de precios están en el blog del lanzamiento y en la ficha del modelo en Qwen Cloud. Las cifras de precio son de Alibaba, no de un tercero que las haya verificado.
El anuncio llega sin datos de latencia ni comparativas de precisión frente a modelos competidores de audio, que es justo lo que decide una integración en tiempo real. Y falta por ver cómo se comporta la detección de emociones y ruido en condiciones reales, donde el audio de una sala y el de una llamada móvil no se parecen en nada. Para quien tenga que elegir proveedor de voz, la pregunta ya no es solo qué modelo transcribe mejor, sino cuánto cuesta equivocarse de proveedor cuando el precio se mueve así.


