ElevenLabs lanza v4 y v4 Turbo con clonación de voz más rápida y control de expresión
Los nuevos modelos de ElevenLabs reducen el tiempo de clonación a 10 s y amplían el soporte a más de 90 idiomas, con una variante optimizada para latencia mínima.

ElevenLabs ha puesto en producción dos versiones de su motor de síntesis: v4 y v4 Turbo. Ambas están diseñadas para generar voz con mayor expresividad y menor latencia, pero cada una prioriza un aspecto diferente.
v4 incorpora una arquitectura nueva que mejora el control vocal, la consistencia entre fragmentos y la velocidad de clonación. La compañía afirma que basta con unos 10 segundos de audio para reproducir una voz con fidelidad aceptable. Además, el modelo tiene en cuenta un contexto más amplio del texto, lo que permite ajustar la entonación y la expresión a lo largo de pasajes extensos. Los inline expression tags introducidos en v3 siguen disponibles, pero ahora pueden apilarse y ejecutarse de forma secuencial, ofreciendo un nivel de granularidad que antes no era posible.
En cuanto a cobertura lingüística, v4 pasa de alrededor de 70 a más de 90 idiomas. ElevenLabs destaca mejoras significativas en japonés, portugués brasileño, mandarín y cantonés, lo que abre la puerta a aplicaciones multilingües con calidad comparable a la de los idiomas principales.
v4 Turbo está orientado a casos de uso donde la latencia es crítica, como agentes de voz conversacionales o asistentes en tiempo real. Sacrifica algo de expresividad para garantizar respuestas más rápidas, mientras que el modelo estándar v4 se centra en contenido de mayor duración y mayor riqueza expresiva.
Ambas variantes comparten la capacidad de clonar voces rápidamente, lo que simplifica la creación de identidades vocales personalizadas para desarrolladores, productoras de contenido o plataformas de e‑learning. La reducción del tiempo de muestra a 10 s también disminuye la carga de datos y el coste asociado al entrenamiento de voces a medida.
Para los equipos de infraestructura, la disponibilidad de una versión “Turbo” significa que pueden elegir entre dos perfiles de rendimiento sin cambiar de proveedor. La arquitectura subyacente parece compatible con los pipelines habituales de despliegue de modelos de IA, y ElevenLabs ofrece acceso a través de su API, lo que facilita la integración en entornos Kubernetes o serverless.
En resumen, la llegada de v4 y v4 Turbo aporta a la comunidad de desarrolladores una herramienta más flexible para generar voz sintética, con opciones que se adaptan tanto a aplicaciones que priorizan la calidad como a aquellas que requieren respuestas inmediatas. Queda por ver cómo la competencia reaccionará y si los precios de la API se ajustarán a la mayor capacidad que ofrecen.


