Synthesia hace un avatar interactivo para una periodista con modelos intercambiables
La empresa británica de vídeo con IA construye gemelos digitales que responden preguntas y deja al cliente cambiar los modelos de voz o alojarlos en su propia nube.

Alexandru Voica, responsable de asuntos corporativos de Synthesia, tiene desde este verano un avatar que responde a la prensa en su lugar. La startup británica de vídeo generado con IA dio un paso más en septiembre: construyó un avatar interactivo para una periodista, el primero que hace para alguien ajeno a la empresa. El interés para quien compra tecnología está debajo, en la pila de modelos: cuatro piezas encadenadas que el cliente puede sustituir por las de otros laboratorios.
Cuatro modelos encadenados
El avatar interactivo traduce a texto lo que dice quien le habla, pasa ese texto por un modelo de lenguaje capaz de actuar sobre él, convierte la respuesta en audio y anima el vídeo con un modelo propio de Synthesia. La compañía usa sus modelos de voz y vídeo por defecto, pero deja al cliente elegir alternativas de Cartesia, ElevenLabs, Google u OpenAI. También puede alojar los avatares en la nube que quiera o pagar a Synthesia para que lo haga.
La fabricación no es instantánea: hizo falta un estudio montado en la oficina, varias sesiones de fotos, una grabación de dos minutos de voz y un consentimiento firmado. El equipo tardó un par de días en entregar las versiones personales, que leen un guion, y las interactivas, que escuchan y contestan, ambas con y sin gafas. Las interactivas son deterministas: solo responden a aquello para lo que se entrenaron, y cuando se les preguntó por datos personales redirigían la conversación al tema preparado.
Tres productos y una valoración de 4.000 millones
Synthesia vende tres cosas. La primera es su plataforma clásica de creación y distribución de vídeo, donde alguien escribe un guion y el avatar lo recita. La segunda es Sessions, una plataforma agéntica con la que los empleados practican presentaciones de venta o responden encuestas hablando con un avatar que puntúa sus respuestas. La tercera es una API para combinar sus modelos de vídeo y voz con servicios de terceros y montar avatares propios. La empresa, con sede en Reino Unido y competidores como D-ID, HeyGen y Colossyan, alcanzó este año una valoración de 4.000 millones de dólares y declaró el año pasado haber superado los 100 millones en ingresos recurrentes anuales.
Para quien decide infraestructura o compras, lo relevante no es el gemelo digital de turno sino las piezas: modelos de voz intercambiables, alojamiento donde quiera el cliente y un avatar que no se sale del guion porque no se le ha entrenado para salirse. Ese punto es la diferencia entre un asistente que se puede poner delante de un cliente y uno que no. Queda por ver si las empresas compran el paquete completo o se quedan solo con la API y montan el resto por su cuenta.

