Kyutai lanza un modelo de voz con capacidad de razonamiento: un modelo de habla que resuelve problemas matemáticos verbalmente utilizando el aprendizaje por refuerzo
Kyutai ha lanzado Voice of Reason, un modelo nativo de habla que resuelve problemas matemáticos a través del razonamiento hablado, utilizando el aprendizaje por refuerzo. El modelo, basado en GLM-4-Voice-9B, incorpora el ajuste fino supervisado y el aprendizaje por refuerzo sin necesidad de transcripción ni de un LLM basado en texto. Logra una precisión del 77,1% en GSM8K hablado, en comparación con el 27,3% del modelo base. El modelo es desplegable para su uso en un entorno propio, y funciona en una única GPU H100 con puntos de control BF16, aunque requiere el repositorio GLM-4-Voice para el procesamiento de voz. Kyutai afirma que esta es la primera aplicación del RL al razonamiento matemático en modelos nativos de habla, con un entrenamiento realizado en 16 GPUs H100 y 1.500 actualizaciones de RL. El modelo utiliza un objetivo de REINFORCE relativo al grupo, similar a GRPO pero sin recorte de PPO ni regularización KL. Los puntos de control liberados reflejan la decodificación top-k 50, con resultados que promedian el 77,1% en tres semillas.
El modelo genera texto e tokens de audio intercalados, con 13 tokens de texto seguidos de 26 tokens de audio. El audio de evaluación proviene de GPT-4o-mini-TTS, que es distinto del audio de entrenamiento. Kyutai también destaca las limitaciones de las tuberías en cascada, que introducen latencia y pierden las señales paralingüísticas. El artículo, el modelo y el modelo Stitch del proyecto están disponibles para su exploración, y se reconoce el trabajo de los investigadores involucrados.