Huawei presenta Spark-Audio-1.0-Preview, un modelo base de voz de origen nacional
El 16 de septiembre de 2026, iFLYTEK anunció el lanzamiento de Spark-Audio-1.0-Preview, un modelo base de voz entrenado completamente utilizando recursos informáticos nacionales.
Este modelo aborda los problemas persistentes de los sistemas tradicionales de procesamiento de audio, que dependían de sistemas en cascada que convertían el habla en texto antes del análisis, lo que provocaba la pérdida de información y flujos de trabajo fragmentados. Spark-Audio-1.0-Preview procesa directamente el audio, comprendiendo el habla, los sonidos ambientales y las emociones, sin pasos intermedios.
Cuenta con un codificador de audio denso de 0,65B y un modelo de lenguaje MoE de 30B-A3B, entrenado con 13 millones de horas de datos de audio y texto.
El modelo admite 99 idiomas y 202 dialectos, superando a competidores como Qwen3.5-omni-flash en tareas multilingües y obteniendo resultados de última generación en el conjunto de datos Fleurs. iFLYTEK afirma que el modelo funciona bien en condiciones ruidosas y de bajo volumen, y ahora está disponible para pruebas públicas con acceso a API planeado para la plataforma abierta.