NVIDIA apresenta nemotron 3 para diarização: um modelo de rastreamento de falantes em tempo real para 8 vozes
A NVIDIA lançou o Nemotron 3 Diarization, um modelo de código aberto capaz de rastrear até 8 falantes em tempo real. O modelo, com 100 milhões de parâmetros, disponível no Hugging Face, utiliza uma combinação de reconhecimento automático da fala (ASR) e diarização para produzir transcrições atribuídas a falantes. Essa capacidade é crucial para aplicações como ferramentas de reuniões, análise de chamadas e memória de agentes de voz. O modelo suporta gravações offline e streaming em tempo real, e seus pesos são disponibilizados sob a licença OpenMDW 1.1, permitindo uso comercial.
A nova versão da NVIDIA dobra o limite de falantes do checkpoint Streaming Sortformer anterior, que suportava 4 falantes. Ele processa áudio de 16 kHz em características de espectrograma Mel e utiliza um codificador Transformer de 31 camadas com incorporações posicionais rotativas. O modelo alcança uma redução relativa de 24% no DER em comparação com o sistema classificado em segundo lugar nos testes de Diarization-Bench da Voice Arena. Também mostra melhorias significativas em várias condições de avaliação, com uma redução relativa média de 41,0%.
O modelo foi treinado em uma mistura de conversas reais e simuladas, incluindo dados da David AI, abrangendo 21 idiomas. Embora apresente bom desempenho, possui limitações, como lidar com mais de 8 falantes ou com ruído e reverberação intensos. A NVIDIA recomenda um buffer de 0,32 segundos para o desempenho ideal e destaca a disponibilidade do modelo através de Baseten e DigitalOcean para uso de produção.