BookinglyTech News
Inteligencia artificial

Nari Labs encabeza los benchmarks de voz de Coval con Qwen3-ASR y Qwen3-TTS

Sus endpoints servidos sobre los modelos Qwen3 quedan primeros en latencia de reconocimiento y en precisión de síntesis, y aguantan el tipo en precio frente a AssemblyAI y ElevenLabs.

2 min de lecturaShow HN0 vistas

Los endpoints de voz de Nari Labs, servidos sobre los modelos Qwen3-ASR y Qwen3-TTS, encabezan los benchmarks públicos de Coval (reconocimiento y síntesis). El dato sale de una captura de un solo día, el 14 de septiembre de 2026 a las 15:00 UTC, y la propia compañía avisa de que esas tablas se recalculan cada media hora. Las cifras son de Coval, no de Nari, aunque quien firma el análisis sea la empresa que sale bien parada.

Reconocimiento: primero en latencia, segundo en precisión

Qwen3-ASR Fast es el más rápido en tiempo hasta el segmento final (TTFS), con 44 ms de mediana. En tasa de error de palabra se queda en 3,6% y solo le supera Universal 3.5 Pro de AssemblyAI, con 3,5%. Lo que aprieta es el precio: 0,12 dólares por hora, empatado como el segundo más barato del directorio de tarifas de Coval entre los que publican tarifa. Universal 3.5 Pro cuesta 3,75 veces más y Deepgram Nova 3, 2,4 veces más. El endpoint Standard, que la compañía sitúa en 0,06 dólares por hora, sería el más barato de la comparativa.

Estos dos números, TTFS y WER, son los que deciden si un agente de voz se siente ágil o si el usuario cree que se ha colgado.

Síntesis: gana en precisión, cede la latencia por poco

Qwen3-TTS Fast firma 3,8% de WER, el mejor del benchmark, con 63 ms de mediana hasta el primer fragmento de audio. Solo baja de ahí vui, de Fluxions, con 49 ms, y lo hace con un modelo de 300 millones de parámetros frente a los 1.700 millones del Qwen3-TTS que sirve Nari. A 10 dólares por millón de caracteres, el endpoint Fast empata en el primer puesto de precio; ElevenLabs Eleven v3 Conversational cuesta 5 veces más y Cartesia Sonic 3.6, 6,5 veces más. El Standard se quedaría en 5 dólares por millón.

El detalle que más dice de este negocio es la comparación con otros que sirven el mismo modelo. El endpoint oficial Qwen3 TTS Flash Realtime registra 8,8% de WER y 692 ms de mediana de TTFA; el endpoint dedicado de Baseten para Qwen3-TTS se queda en 6,0% de WER y 101 ms. Mismos pesos, resultados distintos: aquí se compite con la pila de inferencia, no con el modelo. Esa comparación va aparte porque Coval excluye los endpoints dedicados de sus rankings.

Nari mueve sus APIs de beta pública a GA de pago esta misma semana y dará 20 dólares en créditos a quien ya tuviera cuenta cuando haga el cambio. Para quien esté eligiendo proveedor de voz, lo que importa no es el primer puesto de una tabla sino el paquete: mediana de latencia, WER y precio por hora o por millón de caracteres. Y conviene mirar si el benchmark mide endpoints compartidos o dedicados, porque la producción suele ir por el segundo camino.