NVIDIA lança VoiceChat 11B, modelo de fala bidirecional com latência ultra-reduzida
A NVIDIA disponibilizou o VoiceChat 11B, um modelo de speech-to-speech de 11 mil milhões de parâmetros para conversação em tempo real. Em vez de encadear componentes separados de reconhecimento de fala, modelo de linguagem e síntese vocal, o modelo realiza processamento de áudio bidirecional num sistema unificado, reduzindo a latência para 448 milissegundos. Permite que utilizadores interrompam o agente e suporta chamadas a ferramentas com elevada precisão através de canais de saída separados. A versão atual está disponível publicamente mas é recomendada apenas para investigação, com limitações conhecidas incluindo contexto de áudio máximo de dois minutos e degradação após várias trocas de turnos. O modelo foi treinado com aproximadamente 550 mil horas de áudio.