Alibaba apresenta modelo de áudio avançado com capacidades de interação em tempo real
A equipe Qwen da Alibaba lançou o Qwen-Audio-3.1, um conjunto abrangente de áudio que inclui ASR (reconhecimento automático de fala), TTS (síntese de fala) e interação em tempo real. O modelo central, Qwen-Audio-3.1-Realtime, é um modelo de fala de comunicação bidirecional, projetado para agentes de voz que podem interagir com ferramentas. O preço foi reduzido em até 95% para ASR, com descontos de 70% para TTS e 85% para Realtime. O modelo está disponível como uma API gerenciada via WebSocket no QwenCloud, sem pesos abertos.
O sistema opera usando dois modelos com o mesmo codificador de áudio e design de LLM (modelo de linguagem). Um modelo de decisão de comunicação bidirecional prevê se ouvir, falar, parar ou retomar, enquanto um modelo de fala para texto converte as respostas em fala em streaming. O treinamento envolve três camadas: Pensar, Agir e Falar e Coordenar, com Core-Cocktail SFT, Multimodality OPD e GRPO usados para refinar o modelo. O desempenho do modelo melhorou em vários benchmarks, incluindo taxas de preenchimento reduzidas e capacidades multilíngues aprimoradas.
Os detalhes de preços foram confirmados em 28 de setembro de 2026, com taxas de token variando devido a diferentes métodos de tokenização de áudio entre os provedores. O lançamento inclui modelos adicionais como Qwen-Audio-3.1-ASR-Flash-Filetrans, que se concentra na transcrição de áudio longo offline. A Alibaba também incentiva o envolvimento por meio de mídia social e oportunidades de colaboração para parceiros.