NVIDIA presenta nemotron3diarization, un modelo de IA gratuito para la separación de voz en tiempo real de múltiples oradores
El 27 de septiembre de 2026, NVIDIA anunció el lanzamiento de Nemotron3Diarization, un modelo de IA gratuito con aproximadamente 100 millones de parámetros. Este modelo se especializa en la segmentación del habla y el agrupamiento, lo que permite una identificación precisa de los oradores en las conversaciones. Admite el procesamiento de audio en tiempo real y grabado para hasta ocho oradores simultáneos. El modelo logró una tasa de error del 14,72 % (DER) en el benchmark VoiceArena, superando al sistema en segundo lugar en 4,58 puntos porcentuales.
Nemotron3Diarization de NVIDIA también mejoró con respecto a su predecesor, Streaming Sortformer, con una reducción promedio de la tasa de error del 41 % en ocho escenarios de prueba utilizando un búfer de audio de 1,04 segundos. El modelo ofrece cuatro configuraciones de búfer de audio dinámicas, que van de 0,32 segundos a 30,4 segundos, para equilibrar la latencia y la precisión. Puede funcionar con sistemas de reconocimiento de voz como Parakeet para generar texto con etiquetas de orador anónimas, como 'speaker_2'.
El lanzamiento de este modelo ligero y de alta precisión reduce las barreras técnicas para el análisis complejo del habla. Proporciona un soporte rentable para la grabación de reuniones en tiempo real, el servicio al cliente inteligente y las interacciones de voz con múltiples oradores, acelerando la implementación de la identificación de múltiples oradores en dispositivos periféricos y escenarios comerciales en tiempo real.