Kedaixinfly lança modelo avançado de reconhecimento de voz Spark-ASR-2.0 para entrada de dados e outros produtos
Em 23 de setembro de 2026, a Kedaixinfly anunciou o lançamento do seu mais recente modelo de reconhecimento de voz, Spark-ASR-2.0. O modelo incorpora inovações-chave, como colaboração autoregressiva e não autoregressiva aprimorada por LLM, juntamente com melhorias na transcrição de texto e áudio em chinês e inglês, e injeção dinâmica de contexto, resultando em melhorias significativas no desempenho do reconhecimento de voz. Notavelmente, o modelo se destaca no reconhecimento geral, em cenários acústicos complexos, reconhecimento contextual e fluidez do texto. O custo de inferência aumentou apenas em 10% em comparação com o Spark-ASR-1.0. De acordo com a Kedaixinfly, o Spark-ASR-2.0 não apenas aumenta a precisão, mas também produz texto mais coerente e semanticamente claro, refinando expressões e detalhes redundantes. O modelo será integrado gradualmente ao método de entrada da Kedaixinfly a partir de 24 de setembro de 2026, e também estará disponível através da API da Plataforma Aberta da Kedaixinfly. Será implementado em vários produtos, incluindo os óculos Kedaixinfly AI, o Smart Office Notebook e o Kedaixinfly Hear.
O Spark-ASR-2.0 supera os padrões da indústria em ambientes de dialeto, ruído alto e baixo volume, demonstrando fortes capacidades em cenários acústicos complexos. O desempenho do modelo nessas áreas é significativamente melhor do que o melhor desempenho atual da indústria. A Kedaixinfly enfatizou que o novo modelo representa um avanço em relação às versões anteriores, que se concentravam em transcrever com precisão o conteúdo falado, para gerar texto mais natural e coerente.