VoxCPM2: TTS autoalojado con clonacion, diseno de voz y 30 idiomas
OpenBMB publica bajo Apache-2.0 un modelo de sintesis de voz de 2.000 millones de parametros que clona voces, inventa otras nuevas desde una descripcion y se sirve en tu propia GPU con una API compatible con OpenAI.

VoxCPM2 es un modelo de sintesis de voz de OpenBMB, el equipo detras de la familia MiniCPM, publicado en abril de 2026. Pesa 2.000 millones de parametros, sale bajo licencia Apache-2.0 y cubre tres tareas que antes obligaban a encadenar tres herramientas distintas. El repositorio describe una arquitectura tokenizer-free: en lugar de trocear la senal en tokens discretos, genera representaciones continuas de habla con un esquema difusion-autorregresivo. De ahi que aguante respiraciones, ritmo y cambios de emocion a mitad de frase mejor que los modelos basados en tokens.
Que trae el checkpoint
Un solo modelo cubre TTS normal, diseno de voz y clonacion zero-shot. El diseno de voz funciona con una descripcion escrita: le das "narrador tranquilo de mediana edad con una sonrisa leve" y el modelo se inventa la voz sin necesidad de grabacion de referencia. La clonacion parte de un clip corto de una voz sobre la que tengas derechos; si ademas le pasas la transcripcion del clip, copia la interpretacion completa -ritmo y enfasis-, no solo el timbre.
Son 30 idiomas, entre ellos arabe, hindi, japones y turco, mas nueve dialectos chinos como el cantones y el sichuanes. La salida es de 48 kHz y el uso comercial no lleva regalias ni topes. Los checkpoints anteriores, VoxCPM-0.5B y VoxCPM1.5, siguen disponibles para hardware mas modesto.
Como se despliega
La instalacion es un paquete de pip y unos gigabytes de pesos. pip install voxcpm los descarga desde Hugging Face en la primera ejecucion, y a partir de ahi se usa por CLI o por API de Python. Antes de comprometer hardware conviene probar las frases reales del caso de uso en el playground publico: si la voz falla ahi, te has ahorrado el proyecto de despliegue.
La ruta de produccion recomendada pasa por vLLM-Omni, que expone un endpoint /v1/audio/speech compatible con OpenAI con batching y gestion de cache KV. La documentacion reporta un factor de tiempo real de 0,13 en una RTX 4090 con el backend Nano-vLLM-VoxCPM, frente a 0,3 en la ruta PyTorch pura: se genera varias veces mas rapido de lo que se reproduce. Si tu aplicacion ya llama a endpoints de audio con forma de OpenAI, cambiar de backend es tocar la URL base, no reescribir el cliente.
En cuanto a hierro: el modelo carga en la clase de 8 GB de VRAM, pero en cuanto entran cache KV, concurrencia y prompts largos, una tarjeta de 24 GB marca el suelo comodo para produccion. En Apple Silicon existe la via comunitaria de MLX-Audio, aunque su documentacion avisa de que VoxCPM2 todavia no esta soportado; los checkpoints 1.x si. El proyecto completo esta en el repositorio de VoxCPM.
Frente a las alternativas
ElevenLabs sigue siendo la referencia de calidad y comodidad. Su nivel de calidad cuesta 0,10 dolares por 1.000 caracteres y la gama Flash/Turbo baja a 0,05. Lo que pagas es no operar nada; lo que cedes es control sobre los datos, latencia que no gobiernas y una factura que crece con el uso. Chatterbox, de Resemble AI, va con licencia MIT, cubre 23 idiomas y tiene buen control de exageracion emocional, pero no ofrece diseno libre de voz. Qwen3-TTS de Alibaba es el rival mas parecido en diseno de voz y corre en tan solo 4 GB de VRAM en su version de 0,6B, aunque su lista de idiomas es un tercio de la de VoxCPM2.
La lectura practica que da el propio analisis: autoalojar el grueso de la generacion y quedarse con una API hospedada para el 20% de casos mas dificiles. Para quien factura por caracter, el calculo es sencillo.