Meta lanza Muse Voice Transcribe con diarización para 20 speakers a 0,18 USD la hora
El nuevo modelo de Meta Superintelligence Labs integra transcripción en streaming, detección de endpoints y atribución de hablantes en una sola API.

Meta ha lanzado Muse Voice Transcribe, un modelo de audio que combina transcripción en tiempo real, detección de endpoints y diarización de más de 20 hablantes. La compañía fija el precio de su API pública en 0,18 USD por cada hora de audio procesado, una cifra que busca competir agresivamente con los proveedores actuales en el mercado de voz.
Arquitectura y capacidades
Desarrollado por Meta Superintelligence Labs, Muse no espera a que termine una grabación para procesar el texto. El modelo opera sobre audio que llega en fragmentos de 80 milisegundos. En cada paso, la arquitectura autoregresiva decide si consumir más audio o emitir texto mediante un mecanismo llamado adaptive delay. Esto permite al sistema esperar más tiempo cuando la voz es ambigua y comprometer la salida antes cuando tiene suficiente contexto. Meta entrena la transcripción automática (ASR), la diarización y la detección de límites de habla de forma conjunta, eliminando la necesidad de un pipeline de post-procesamiento separado para la atribución de hablantes.
El modelo está entrenado en más de 70 idiomas, aunque 25 están extensamente validados para este lanzamiento inicial. Soporta code-switching multilingüe, sesgo por palabras clave y audios de larga duración que superan la hora. La diarización asigna etiquetas por sesión (como A o B) y ofrece marcas temporales a nivel de turno, no de palabra.
Contexto competitivo
La cifra de 20 hablantes posiciona a Muse en el extremo alto, pero no es un récord absoluto. Speechmatics documenta una capacidad de 50 hablantes por defecto, ampliable a 100 en transcripción en tiempo real, mientras que Amazon Transcribe soporta hasta 30 hablantes únicos. Soniox y AssemblyAI siguen detrás con máximos de 15 y 10 respectivamente.
Además, Meta no ha demostrado públicamente 20 participantes simultáneos en sus demos; su principal demostración en vivo usa ocho speakers y su grabación de larga forma incluye 11. La cifra de 20+ es una capacidad declarada del modelo, no un resultado mostrado.
Para los arquitectos de sistemas de reuniones, analítica de llamadas o asistentes de ambiente, el valor de Muse reside en la integración de alta capacidad de diarización con latencia baja y un precio de API que reduce el coste operativo frente a soluciones desacopladas.
