Meta presenta Muse Voice Transcribe, su modelo de audio en tiempo real
El nuevo modelo de Superintelligence Labs transcribe, separa hablantes y detecta frases con un retardo inferior a 0,16 segundos.

Meta ha lanzado Muse Voice Transcribe, su primer modelo de percepción de audio en tiempo real desarrollado por la división Superintelligence Labs. La herramienta transcribe el habla, distingue entre hablantes y detecta los límites de las oraciones mientras la conversación está en curso, sin necesidad de sistemas de posproceso. El objetivo declarado es sentar las bases para asistentes de IA que escuchen de forma continua.
Arquitectura y rendimiento
El modelo, perteneciente a la familia Spark, procesa la entrada de audio en fragmentos de 80 milisegundos. Tras cada fragmento, decide si debe seguir escuchando o si ya puede emitir la siguiente palabra como texto. Este mecanismo dinámico ajusta el retardo según la dificultad de la palabra: las más simples se transcriben rápido, mientras que las complejas esperan más contexto para reducir errores. Meta entrenó esta conducta con aprendizaje por refuerzo, premiando simultáneamente la baja tasa de error y la latencia corta.
En pruebas independientes de Artificial Analysis realizadas el 1 de septiembre de 2026, Muse Voice Transcribe logró una tasa de error de palabra (WER) del 3,1% en inglés, con un retardo de 0,16 segundos tras el final de la frase. Esto lo sitúa por delante de ElevenLabs Scribe v2 Realtime (3,6% WER, 0,14s), AssemblyAI Universal-3.5 Pro Realtime (4,0% WER) y Cartesia Ink-2 (entre 3,4% y 4,0% WER, dependiendo de la detección de finales).
El modelo maneja más de 70 idiomas, con 25 probados en profundidad, y soporta code-switching (cambios de idioma a mitad de frase). Una de sus características técnicas destacadas es la separación de hablantes integrada: puede distinguir hasta 20 hablantes simultáneos en grabaciones de más de una hora, asignando etiquetas de A a Z a cada intervención en tiempo real. No es un sistema aparte, sino una tarea entrenada conjuntamente con el reconocimiento de voz.
Disponibilidad y precios
Muse Voice Transcribe está disponible a través de la Meta Model API y ya impulsa la dictado de voz en Meta AI y Muse Code. También puede probarse manteniendo pulsada la tecla Fn en cualquier aplicación compatible. El precio es agresivo: 0,18 dólares por hora de audio, lo que equivale a 3 dólares por 1.000 minutos. Esta tarifa es inferior a la de Cartesia Ink-2 (4 dólares) y de ElevenLabs Scribe v2 Realtime o Deepgram Flux (6,50 dólares cada uno).
Meta no ha publicado el número de parámetros, el volumen de datos de entrenamiento ni las fuentes de los audios, y no liberará los pesos del modelo. El lanzamiento se enmarca en la visión de Mark Zuckerberg sobre una "superinteligencia personal", aunque la compañía no ha detallado cómo se integrará en dispositivos como las gafas de realidad aumentada, cuyo uso en Alemania ha generado recientes debates regulatorios.
