NVIDIA presenta nemotron 3 diarización: un modelo de seguimiento de oradores en tiempo real para 8 voces
NVIDIA ha lanzado Nemotron 3 Diarización, un modelo de código abierto capaz de rastrear hasta 8 oradores en tiempo real. El modelo de 100 millones de parámetros, disponible en Hugging Face, utiliza una combinación de reconocimiento automático del habla (ASR) y diarización para generar transcripciones atribuidas a oradores. Esta capacidad es crucial para aplicaciones como herramientas de reuniones, análisis de llamadas y memoria de agentes de voz. El modelo admite grabaciones offline y transmisión en tiempo real, y sus pesos están disponibles bajo la licencia OpenMDW 1.1, lo que permite su uso comercial.
El nuevo modelo de NVIDIA duplica el límite de oradores del punto de control anterior de Streaming Sortformer, que admitía 4 oradores. Procesa audio de 16 kHz en características de espectrograma Mel y utiliza un codificador Transformer de 31 capas con incrustaciones de posición rotatoria. El modelo logra una reducción relativa del 24% en DER en comparación con el sistema de clasificación siguiente en las pruebas Diarization-Bench de Voice Arena. También muestra mejoras significativas en varias condiciones de evaluación, con una reducción relativa media del 41,0%.
El modelo se entrenó con una mezcla de conversaciones reales y simuladas, incluidas los datos de David AI, que abarcan 21 idiomas. Si bien funciona bien, tiene limitaciones, como el manejo de más de 8 oradores o el manejo de ruido y reverberación importantes. NVIDIA recomienda un búfer de 0,32 segundos para un rendimiento óptimo y destaca la disponibilidad del modelo a través de Baseten y DigitalOcean para su uso en producción.