Kedaixinfly lanza el modelo de reconocimiento de voz Spark-ASR-2.0 mejorado para el método de entrada y otros productos
El 23 de septiembre de 2026, Kedaixinfly anunció el lanzamiento de su último modelo de reconocimiento de voz, Spark-ASR-2.0. El modelo incorpora innovaciones clave como la colaboración autoregresiva y no autoregresiva mejorada con LLM, el procesamiento de texto y acústica mixtos chino-inglés, y la inyección dinámica de contexto, lo que resulta en mejoras significativas en el rendimiento del reconocimiento de voz. En particular, el modelo destaca en el reconocimiento general, escenarios acústicos complejos, reconocimiento contextual y fluidez del texto. El coste de inferencia solo ha aumentado un 10% en comparación con Spark-ASR-1.0. Según Kedaixinfly, Spark-ASR-2.0 no solo mejora la precisión, sino que también produce texto más coherente y semánticamente claro, refinando las expresiones y los detalles redundantes. El modelo se integrará gradualmente en el método de entrada de Kedaixinfly a partir del 24 de septiembre de 2026, y también estará disponible a través de la API de la Plataforma Abierta de Kedaixinfly. Se implementará en varios productos, incluidos las gafas Kedaixinfly AI, el Smart Office Notebook y Kedaixinfly Hear.
Spark-ASR-2.0 supera los estándares de la industria en entornos de dialecto, ruido alto y bajo volumen, demostrando sólidas capacidades en escenarios acústicos complejos. El rendimiento del modelo en estas áreas es significativamente mejor que el mejor estándar actual de la industria. Kedaixinfly enfatizó que el nuevo modelo representa un paso adelante en comparación con las versiones anteriores, que se centraban en la transcripción precisa del contenido hablado, para generar texto más natural y coherente.