Nvidia libera Nemotron 3 Diarization, un modelo de 100 millones de parámetros
Separa hasta ocho hablantes en tiempo real, detecta voces solapadas y sus pesos son libres. Encabeza la tabla de diarización con un 14,7% de error

Nvidia ha publicado Nemotron 3 Diarization, un modelo de unos 100 millones de parámetros que señala quién habla en cada momento dentro de una conversación. Los pesos están disponibles sin coste en Hugging Face y el modelo distingue hasta ocho hablantes, además de detectar cuándo dos personas hablan a la vez. Funciona igual con audio grabado que con audio en directo.
La diarización —etiquetar tramos de audio con la identidad de quien habla— es la pieza que convierte una transcripción plana en un diálogo atribuible. Nemotron 3 no genera texto: hay que emparejarlo con un sistema de reconocimiento de voz, como Parakeet, para sacar transcripciones con etiquetas. Y son etiquetas anónimas, del tipo "speaker_2". El modelo separa voces, no las identifica por nombre.
Los números
En VoiceArena Diarization Benchmark v1, la referencia que usa el propio fabricante, el modelo se coloca primero con una tasa de error de diarización (DER) del 14,7%, por delante del siguiente sistema, que se queda en el 19,3%. Frente a su predecesor, Streaming Sortformer, recorta el error una media del 41% en ocho escenarios de prueba con un búfer de 1,04 segundos.
Esa prueba es dura: cuenta la voz solapada y puntúa como fallo desalineaciones mínimas en los cambios de turno. El 14,7% no sale de un escenario fácil.
El modelo expone cuatro niveles de búfer de audio, entre 30,4 y 0,32 segundos. Cuanto más corto el búfer, menos latencia y menos precisión: ese ajuste marca el equilibrio entre responder rápido y acertar.
También importa lo que no hace bien. Más participantes, ruido de fondo intenso o reverberación empujan la tasa de error hacia arriba. Ocho hablantes es el techo declarado, y una sala con eco o una llamada con mala acústica no son el caso ideal.
Para quien despliega esto, el interés está en que sean pesos abiertos y en el tamaño: 100 millones de parámetros caben en hardware modesto y no obligan a mandar el audio a la API de un tercero, algo que en según qué entornos pesa más que un punto de precisión. Queda por ver si el primer puesto aguanta cuando lleguen los siguientes modelos y si Nvidia mantiene la licencia tal y como está hoy.

