BookinglyTech News
Inteligencia artificial

Un finetuner universal de TTS que ya cubre 17 motores, con Docker y CLI

Universal_TTS_Finetune centraliza el ajuste fino de modelos de síntesis de voz, desde XTTS v2 hasta Tacotron2, y se puede usar por interfaz web, por línea de comandos o en contenedor

2 min de lecturar/selfhosted0 vistas

El autor de ebook2audiobook ha publicado Universal_TTS_Finetune, una herramienta para hacer ajuste fino sobre modelos de síntesis de voz que ya cubre 17 motores distintos. Se maneja desde una interfaz web o desde la línea de comandos, y hay imagen Docker para quien prefiera levantarla en un contenedor. El anuncio lo hizo el propio desarrollador en r/selfhosted, sin demo pública ni fecha de lanzamiento formal: el proyecto viene de su tiempo libre.

Qué entra y qué no

La lista de motores soportados mezcla arquitecturas de varias generaciones. Están XTTS v1 y v2, Piper TTS, VITS, MMS/Fairseq VITS, FastPitch, FastSpeech y FastSpeech 2, Glow-TTS, DelightfulTTS, las tres variantes de Tacotron2 que circulan (DCA, DDC y Capacitron), Overflow, SpeedySpeech, Align TTS y NeuralHMM-TTS. Son 17 según el recuento del propio autor. La gracia es que el mismo flujo de ajuste sirva para todas, en lugar de mantener un repositorio distinto por familia de modelo, que es lo habitual hoy.

El caso de uso que el autor destaca es encadenarlo con ebook2audiobook. De ahí se sacan datos sintéticos a partir de una clonación de voz, y con ellos se destila esa misma voz en un modelo Piper pequeño, pensado para correr con pocos recursos. Es decir: tomas una muestra de voz, generas material de entrenamiento y acabas con un motor ligero afinado para esa voz.

Lo que no dice

En el anuncio no hay licencia, ni benchmarks, ni muestras de audio comparativas, ni una tabla que aclare hasta qué punto el soporte de cada motor está probado. Tampoco hay demo. El autor avisa de que grabará un vídeo en los próximos días y de que el proyecto es bastante nicho, algo razonable cuando quien lo va a usar ya tiene que pelearse con datasets de audio, transcripciones y checkpoints.

Para quien autohospeda TTS, el valor está en la unificación: una sola herramienta que habla con un montón de backends ahorra pegamento propio, sobre todo si ya tienes un Piper o un XTTS en producción. Queda por ver si el soporte de los 17 motores es uniforme o si algunos están solo a medio camino. Ahí se decide si esto es una capa útil o una lista larga con la mitad sin probar.