NVIDIA publica Nemotron 3.5 ASR, un modelo de voz abierto de 600 millones de parámetros
Reconoce 40 locales desde un único checkpoint, corre en local y trae puntuación y mayúsculas de serie. Los pesos están abiertos para afinarlos por idioma, dominio o acento.

NVIDIA ha liberado los pesos de Nemotron 3.5 ASR, un modelo de reconocimiento de voz de 600 millones de parámetros que cubre 40 locales de idioma desde un único checkpoint y trabaja en tiempo real. Se puede descargar, inspeccionar, afinar y ejecutar en local: sin dependencia de una API externa y sin coste por llamada. La salida llega con puntuación y mayúsculas restauradas, así que no hace falta un paso posterior de limpieza.
Por debajo hay una arquitectura Cache-Aware FastConformer-RNNT, diseñada para reconocimiento en streaming, que es donde el modelo se mueve bien: latencia baja, texto según va entrando el audio. Eso lo coloca en el terreno de los agentes de voz, el subtitulado en vivo y el análisis de conversaciones de centro de contacto. Hay ya un ejemplo de subtitulado multilingüe montado sobre este checkpoint.
Pesos abiertos y una guía para afinarlo
El interés no está tanto en el modelo base como en lo que se pueda construir encima. Al ser un checkpoint abierto, un equipo puede ajustarlo para un idioma concreto, para la jerga de un sector (sanitario, legal, financiero) o para un acento determinado, en lugar de entrenar desde cero. El equipo de investigación de NVIDIA publicó en el blog de Hugging Face el proceso completo en cinco pasos —preparación de datos, entrenamiento, evaluación, escalado y despliegue— con lo necesario para reproducirlo: la guía de cinco pasos.
Para quien despliega en el borde o en un entorno privado, el argumento es doble: el audio no sale de la infraestructura propia y desaparece la factura por minuto transcrito. La soberanía del dato, que hasta hace poco era un criterio de compra secundario, se está colando en las primeras posiciones de la lista.
Falta lo de siempre en este tipo de anuncios. No hay cifras de precisión por idioma ni comparación contra alternativas, y los 40 locales son los que declara el fabricante, no una medición independiente. Tampoco basta con que los pesos estén abiertos: hay que leer la licencia antes de meterlo en un producto. Y la latencia en streaming depende mucho del hardware sobre el que se ejecute, algo que ningún checkpoint resuelve por sí solo.
El camino corto para evaluarlo es descargar los pesos, seguir la guía de ajuste y medir la tasa de error sobre muestras reales del idioma y del dominio propios. Ahí se verá si el modelo aguanta la jerga de cada casa o si necesita más ajuste. Los reconocedores de voz abiertos llevan tiempo siendo suficientes para según qué tareas; la pregunta, un modelo más, es si este lo es para la tuya.

