BookinglyTech News
Inteligencia artificial

JaiTTS clona voz en tailandes con menos errores que la referencia humana en clips cortos

El modelo de JTS baja el CER al 1,94% frente al 1,98% humano en audio breve, se publica bajo Apache 2.0 y procesa cifras y palabras en ingles sin normalizacion previa.

3 min de lecturaDev.to0 vistas

JaiTTS-v1.0 es un modelo de clonacion de voz en tailandes que baja el CER al 1,94% en clips cortos, frente al 1,98% de la referencia humana en el mismo conjunto de prueba. El equipo de JTS (Jasmine Technology Solution) publico el trabajo en arXiv el 30 de abril de 2026 y dejo el codigo en el repositorio del proyecto, con los pesos en Hugging Face. La licencia es Apache 2.0, asi que se puede meter en productos y servicios de pago.

El CER (Character Error Rate) mide la proporcion de caracteres mal transcritos: cuanto mas bajo, mejor. La diferencia de 0,04 puntos es minima, y ahi esta la trampa del titular. Lo que indica no es que el modelo sea infalible, sino que ha alcanzado el suelo que marca la propia inconsistencia humana. Dos hablantes nativos transcribiendo el mismo audio no coinciden letra a letra, y en tareas cortas el modelo se ha metido dentro de ese margen.

Arquitectura y normalizacion

La base es VoxCPM, una arquitectura TTS autoregresiva que no usa tokenizer, y el equipo la entreno de forma continua sobre un corpus de voz en tailandes grande. El detalle que mas pesa en el dia a dia es otro: el modelo procesa cifras y palabras en ingles mezcladas con tailandes sin pasar por una fase de text normalization. Es decir, se traga directamente un numero de telefono, un precio con digitos o el nombre de una herramienta en alfabeto latino. Los sistemas que normalizan antes suelen romperse justo ahi, y el equipo lo presenta como uno de los cuatro resultados principales del paper.

Los numeros, con matices

La tabla del paper mezcla dos metricas que van en direcciones opuestas. El CER es error (mas bajo, mejor) y el SIM es parecido con el hablante original (mas alto, mejor). Conviene no leerlas juntas.

En clips cortos, JaiTTS marca 1,94 de CER y 0,62 de SIM; el humano de referencia, 1,98 y 0,61. En clips largos la cosa se invierte: 2,55 de CER frente a 2,47 humano, y un SIM de 0,76 contra 0,83. Ademas, su SIM no es el mas alto de la tabla: VoxCPM2 llega a 0,68 en corto y Omnivoice a 0,82 en largo, por encima del modelo de JTS en ambos casos. ThonburianTTS, que se publico antes, aparece con 6,26 de CER y sin resultados en formato largo.

La parte que mas peso tiene no es el CER, sino una prueba ciega con 20 evaluadores nativos, 30 voces de referencia (15 masculinas y 15 femeninas) y 400 pares comparados contra sistemas comerciales. JaiTTS gano 283, empato 59 y perdio 58. Contra eleven_v3 el marcador fue 161-19-20; contra speech-2.8-hd, 122-40-38. El equipo publica las derrotas sin esconderlas.

En velocidad, el RTF de JaiTTS es 0,1136, unas nueve veces mas rapido que el tiempo real. ThonburianTTS queda casi igual con 0,1150, pese a triplicar el error: accuracy y velocidad no van de la mano. Los Qwen3-TTS se van por encima de 1,0, o sea que tardan mas de lo que dura el audio que generan.

Que mirar antes de mover ficha

La diferencia de licencia es la que decide en produccion. JaiTTS va con Apache 2.0; ThonburianTTS reparte codigo MIT pero modelo bajo CC BY-NC-SA 4.0, que prohibe el uso comercial.

Y hay que leer los numeros con la fuente en la mano. La tabla sale del conjunto de prueba del propio equipo, no de un benchmark independiente, y los rivales los eligieron ellos. El repositorio declara codigo de benchmark, no esta claro que incluya el pipeline completo de sintesis. El 30 de abril de 2026 es la fecha de envio a arXiv, no un lanzamiento de producto. Y "mas preciso que un humano" solo aplica a clips cortos: en audio largo pierde contra la referencia humana y el SIM cae de forma clara. Hay demo publica para probarlo con texto propio, que es la unica forma de saber si la promesa de no normalizar aguanta con vuestros datos.