BookinglyTech News
Inteligencia artificial

iFlytek lanza Spark-Audio-1.0-Preview, un modelo de voz entrenado con cómputo chino

El modelo combina un codificador de audio de 0,65B con un LLM MoE de 30B-A3B y cubre 99 idiomas y 202 dialectos. La API llegará más adelante a la plataforma abierta de la compañía.

2 min de lecturaITHome0 vistas

iFlytek ha abierto el acceso a Spark-Audio-1.0-Preview, un modelo base de voz entrenado íntegramente en clústeres de cómputo de fabricación china. La compañía lo plantea como alternativa a la arquitectura en cascada que usa casi todo el mundo para que un modelo grande entienda audio.

Esa cascada consiste en transcribir primero el habla a texto y pasar después el texto al LLM. iFlytek señala dos problemas conocidos por cualquiera que haya montado ese pipeline: se pierde información —el tono, la emoción, el ruido de fondo, todo lo que no cabe en una transcripción— y la cadena se rompe en módulos independientes (transcripción, identificación de locutor, traducción) que acumulan errores y añaden latencia. Su propuesta es un modelo que consume audio directamente y lo interpreta junto al texto.

Arquitectura y datos

El bloque de audio es un codificador denso de 0,65B de parámetros; el lenguaje corre sobre un MoE de 30B-A3B. El entrenamiento usó 13 millones de horas de audio más datos de texto. El modelo acepta las dos modalidades en la misma entrada y resuelve transcripción, traducción multilingüe, reconocimiento de dialectos, identificación de sonidos ambientales, identificación de hablante, análisis de sentimiento y preguntas y respuestas sobre audio.

Cubre 99 idiomas y 202 dialectos. iFlytek dice que se puede afinar igual que en su familia 1+N para construir modelos específicos de reconocimiento, interpretación simultánea o interacción por voz.

Los números que enseña la compañía

Las cifras son suyas, no de un tercero. En Fleurs, Kespeech y LibriSpeech —inglés, chino, multilingüe y dialectos— afirma que Spark-Audio-1.0-Preview puntúa por encima de Gemini-3.1 Pro, y que alcanza SOTA en el conjunto Fleurs de chino. Frente a Qwen3.5-omni-flash (35B-A3B), de tamaño comparable, saca ventaja en reconocimiento multilingüe y multidialectal; frente a Qwen3.5-omni-plus, un orden de magnitud mayor, queda cerca. La ventaja se concentra según ellos en escenarios reales: ruido alto y voz baja.

En las métricas habituales del sector, el reconocimiento de voz se evalúa con WER/CER (más bajo, mejor), la traducción de voz con BLEU, y el resto con exactitud.

iFlytek también admite dónde no destaca: en conocimiento general, matemáticas y código no ve degradación apreciable, pero en seguimiento de instrucciones, diálogo y comprensión de audio todavía tiene recorrido por delante.

El modelo ya se puede probar; la API se anuncia para más tarde en la plataforma abierta de iFlytek. Para quien tenga que montar un pipeline de voz, la pregunta ya no es si un modelo base de audio puede sustituir a la cascada clásica —la industria lleva tiempo moviéndose en esa dirección— sino cuánto cuesta operarlo y bajo qué licencia se distribuye, algo que el anuncio no aclara.