lupAI
Pesquisa & Papers

Kyutai lança a 'voz da razão': um modelo de fala que resolve problemas matemáticos verbalmente usando aprendizado por reforço

Kyutai + Voice of ReasonFonte: MarkTechPost23/09/2026, 04:52
A Kyutai lançou a 'Voice of Reason', um modelo nativo de fala que resolve problemas matemáticos através do raciocínio verbal, utilizando aprendizado por reforço. O modelo, construído sobre o GLM-4-Voice-9B, incorpora ajuste fino supervisionado e aprendizado por reforço sem exigir transcrição ou um LLM baseado em texto separado. Alcança 77,1% de precisão no GSM8K falado, em comparação com 27,3% no modelo base. Pode ser implantado para auto-hospedagem, o modelo executa em uma única GPU H100 com checkpoints BF16, embora exija o repositório GLM-4-Voice para o processamento de fala. A Kyutai afirma que esta é a primeira aplicação de RL ao raciocínio matemático em modelos nativos de fala, com treinamento realizado em 16 GPUs H100 e 1.500 atualizações de RL. O modelo utiliza um objetivo de REINFORCE relativo ao grupo, semelhante ao GRPO, mas sem corte PPO ou regularização KL. Os checkpoints liberados refletem a decodificação top-k 50, com resultados médios de 77,1% em três sementes. O modelo produz intercala tokens de texto e áudio, com 13 tokens de texto seguidos por 26 tokens de áudio. O áudio de avaliação veio do GPT-4o-mini-TTS, distinto do áudio de treinamento. A Kyutai também destaca as limitações das pipelines em cascata, que introduzem latência e perdem pistas paralinguísticas. O artigo, o modelo e o modelo Stitch do projeto estão disponíveis para exploração adicional, com crédito dado aos pesquisadores envolvidos.
Kyutai lança a 'voz da razão': um modelo de fala que resolve problemas matemáticos verbalmente usando aprendizado por reforço — lupAI