BookinglyTech News
Inteligencia artificial

Hugging Face estrena un ranking abierto para evaluar modelos de texto a voz

Con más de 8.000 modelos TTS en el Hub, la falta de métricas estándar frenaba la comparación objetiva entre sistemas open source y multilingües.

2 min de lecturaHugging Face Blog0 vistas

Hugging Face ha lanzado el Open TTS Leaderboard, una herramienta de evaluación objetiva para modelos de texto a voz (TTS) centrada en el software open source y el soporte multilingüe. La iniciativa surge ante la saturación del mercado: hay más de 8.000 modelos disponibles en el Hub, pero los sistemas de ranking existentes, basados en preferencias humanas mediante votos, no escalan al ritmo de los lanzamientos y suelen marginar a las alternativas de código abierto.

El nuevo ranking elimina la dependencia de las votaciones automáticas (Elo) y se apoya en métricas cuantificables ejecutadas sobre hardware específico (GPU H200 y CPU). Esto reduce el tiempo de evaluación de semanas a pocas horas. Los tres pilares de la puntuación son:

  • Inteligibilidad: Medida mediante la tasa de error de palabras (WER) y caracteres (CER) entre el texto original y la transcripción del audio generado, utilizando el modelo Qwen3 ASR.
  • Velocidad: Se mide el factor inverso de tiempo real (RTFx) para inferencia por lotes y el tiempo hasta la primera salida de audio (TTFA) para streaming con tamaño de lote 1.
  • Similitud del hablante: Calculada mediante la similitud coseno de los embeddings WavLM entre el audio generado y el clip de referencia, crucial para el clonación de voz.

A diferencia de los rankings basados en arenas, donde solo 16 de los 92 modelos de Artificial Analysis son open-weights, este nuevo tablero permite comparar directamente modelos como Kokoro-82M, supertonic-3 o s2-pro en inglés, así como OmniVoice o Fun-CosyVoice3 en contextos multilingües. Para lenguas basadas en caracteres como el chino, japonés y coreano, el sistema reporta CER en lugar de WER.

Limitaciones y uso práctico

La dirección de Hugging Face matiza que estas métricas no sustituyen al criterio humano. WER y SIM son proxies de inteligibilidad e identidad de voz, pero no capturan la naturalidad ni la expresividad, dimensiones donde sigue siendo decisivo el oído del usuario. Por eso, la plataforma incluye una pestaña de "Escuchar" que permite a los desarrolladores comparar salidas generadas y emitir votos manuales, combinando así los datos objetivos con la preferencia subjetiva de la comunidad.

Este enfoque es relevante para arquitectos de software que integren agentes de voz, ya que el TTFA es un métrica crítica para la latencia en aplicaciones interactivas. Al estandarizar las pruebas en un entorno controlado, el Open TTS Leaderboard facilita la toma de decisiones técnicas basadas en rendimiento real medible, no solo en opiniones anecdóticas.