ElevenLabs factura 600 millones al año y sus inversores la valoran en 22.000
La compañía de voz sintética dice que más de la mitad de su negocio ya es enterprise y su CEO no teme recortar margen con tal de ganar cuota.

ElevenLabs asegura que va a un ritmo de 600 millones de dólares de ingresos recurrentes anuales y sus inversores la valoran en 22.000 millones, cuatro años después de fundarse. Su consejero delegado y cofundador, Mati Staniszewski, ha pasado por una entrevista en la conferencia Nrth de Toronto para hablar de márgenes, de la posible salida a bolsa y de si las empresas deben decir al cliente que al otro lado hay un bot.
El negocio de ElevenLabs es la capa de voz de la IA: convierte texto en habla que suena humana. Buena parte de la gente se topa con ella en la atención al cliente, muchas veces sin saberlo. Klarna atiende con ella el soporte telefónico de primera línea de 35 millones de clientes en Estados Unidos, y por la lista de clientes pasan también Deutsche Telekom, Cisco, Adobe y varios gobiernos. Además vende a creadores, que la usan para audiolibros, doblaje y música.
Sobre el reparto de las cuentas: más del 55% del negocio es enterprise clásico, y buena parte del 45% restante son pymes, desarrolladores y creadores. La valoración de 22.000 millones es la que le ponen sus inversores, no un cálculo independiente.
Competir con quien fue tu cliente
Staniszewski reconoce que las fronteras del sector se han desdibujado. Decagon, una plataforma de IA conversacional, entrenó su producto de voz con ElevenLabs y ahora lanza consultas contra sus propios modelos, es decir, compite con quien fue su proveedor. El CEO lo mete en un patrón general: las empresas de modelo se vuelven plataformas y las plataformas se vuelven aplicaciones. Pone a Anthropic como ejemplo de ese recorrido.
En cuanto a qué modelos usa cada despliegue, no ve una elección binaria entre open weight y laboratorios de frontera. Si la llamada es informativa y no ejecuta acciones, los modelos abiertos bastan, porque la base de conocimiento define qué es una buena respuesta. Si hay dinero de por medio —autenticación, consulta de una transacción, una devolución—, el margen de error desaparece y mandan los modelos de frontera. El modelo final depende del cliente: un gobierno puede exigir residencia de datos y un ajuste propio. En Polonia el caso es sanitario: agentes que llaman a pacientes para recordarles citas, en un sistema donde el 18% no se presenta.
Sobre transparencia, su posición es que ahora mismo sí debería avisarse de que quien atiende es un agente. La gente no está acostumbrada y el patrón habitual es no querer sentirse engañado en esa llamada, viene a decir. En cinco años, cuando cada cual tenga su propio agente, la expectativa se dará la vuelta. Como fórmula práctica propone dar la opción: si hay 30 minutos de espera para un humano, que el cliente elija, y casi siempre elige al agente.
De márgenes brutos no dio cifras. Dijo que no iba a detallarlas y que no le importa que se estrechen si eso sirve para ganar cuota y demostrar valor junto al cliente en los próximos cinco años. El dato de los 600 millones es suyo.
Un apunte sobre los datos de entrenamiento: el trabajo no ha estado tanto en el volumen como en la anotación. La compañía tiene a miles de personas contratadas para marcar no solo qué se dijo, sino cuándo hablaba cada interlocutor, cómo lo decía y con qué emoción. Para eso ha metido entrenadores de voz.
Queda por ver si el objetivo que se marca —pasar el test de Turing en IA conversacional, con inteligencia emocional incluida— aguanta cuando la calidad del audio deje de ser una ventaja diferencial, algo que el propio Staniszewski daba por hecho hace un año.


