iFlytek lanza Spark-ASR-2.0 y promete más precisión en ruido y dialectos
El nuevo modelo de reconocimiento de voz de la compañía china llega mañana a su teclado y a su plataforma abierta como API, con un 10% más de coste de inferencia que la versión anterior.

iFlytek ha presentado Spark-ASR-2.0, la segunda generación de su modelo de reconocimiento de voz. Desde mañana se despliega de forma progresiva en el teclado de la casa y se ofrece como API a través de su plataforma abierta. Las mejoras que la compañía destaca están en la mezcla de chino e inglés, los dialectos, los entornos ruidosos y la fluidez del texto que sale por pantalla, y todo ello con un coste de inferencia que sube solo un 10% respecto a Spark-ASR-1.0.
Qué hay debajo
El modelo combina dos estrategias: una rama no autorregresiva y otra autorregresiva reforzada con un LLM, que trabajan juntas. A eso se suman un refuerzo conjunto de texto y acústica pensado para el habla mezclada de chino e inglés, y la inyección dinámica de contexto, que permite meter palabras y frases concretas para que el reconocedor no las confunda con homófonos. iFlytek lleva años vendiendo reconocimiento de voz como servicio, así que la novedad aquí no es la arquitectura en sí, sino hasta dónde llega en las condiciones malas.
Esas condiciones malas son las que la compañía enumera: ruido alto, volumen bajo, gente que habla rápido y niños. También menciona los términos técnicos y las frases mezcladas de dos idiomas, que suelen ser el punto donde los reconocedores se rompen. La métrica que usan es la de siempre, WER para el reconocimiento y CER para los caracteres, y cuanto más baja mejor. La compañía afirma que la tasa de error baja de forma clara en todos los escenarios frente a la versión anterior, y que en dialectos, ruido y volumen bajo queda por delante de lo mejor que hay en el sector.
Conviene leer esa última parte con cuidado. La comparación es suya, no de un tercero: la nota no publica ni un solo valor numérico de WER ni los conjuntos de evaluación completos. Los datos de prueba salen de peticiones reales de sus propios productos y se van actualizando, según su descripción: la app de Spark, iFlytek Hearing, el traductor, el teclado y las llamadas de desarrolladores a la API de voz de su plataforma abierta. Es un origen razonable y también es un origen que ellos controlan.
Dónde va a caer
El primer destino es el teclado, donde el dictado es la función que más se usa y la que más se nota cuando falla. Después, la API en la plataforma abierta, que es la vía por la que un desarrollador puede integrar el modelo sin comprar ningún dispositivo. iFlytek menciona además gafas con IA, cuadernos inteligentes de oficina y su producto de transcripción, así que el modelo va a acabar detrás de bastante hardware propio.
Para quien tenga voz en la arquitectura de un producto, lo interesante no es el titular de las mejoras sino los dos datos que faltan: cuánto cuesta exactamente cada llamada a la API y si ese 10% extra de inferencia se traslada al precio. Una mejora de precisión en dialectos y ruido vale poco si el coste por minuto de audio se dispara. La compañía no ha dado ninguna de las dos cifras.

