lupAI
novos-desenvolvimentos

NVIDIA presenta nemotron3diarization, un modelo de IA gratuito para la separación de voz en tiempo real de múltiples oradores

NVIDIAFuente: AIBase28/09/2026, 10:53
El 27 de septiembre de 2026, NVIDIA anunció el lanzamiento de Nemotron3Diarization, un modelo de IA gratuito con aproximadamente 100 millones de parámetros. Este modelo se especializa en la segmentación del habla y el agrupamiento, lo que permite una identificación precisa de los oradores en las conversaciones. Admite el procesamiento de audio en tiempo real y grabado para hasta ocho oradores simultáneos. El modelo logró una tasa de error del 14,72 % (DER) en el benchmark VoiceArena, superando al sistema en segundo lugar en 4,58 puntos porcentuales. Nemotron3Diarization de NVIDIA también mejoró con respecto a su predecesor, Streaming Sortformer, con una reducción promedio de la tasa de error del 41 % en ocho escenarios de prueba utilizando un búfer de audio de 1,04 segundos. El modelo ofrece cuatro configuraciones de búfer de audio dinámicas, que van de 0,32 segundos a 30,4 segundos, para equilibrar la latencia y la precisión. Puede funcionar con sistemas de reconocimiento de voz como Parakeet para generar texto con etiquetas de orador anónimas, como 'speaker_2'. El lanzamiento de este modelo ligero y de alta precisión reduce las barreras técnicas para el análisis complejo del habla. Proporciona un soporte rentable para la grabación de reuniones en tiempo real, el servicio al cliente inteligente y las interacciones de voz con múltiples oradores, acelerando la implementación de la identificación de múltiples oradores en dispositivos periféricos y escenarios comerciales en tiempo real.
NVIDIA presenta nemotron3diarization, un modelo de IA gratuito para la separación de voz en tiempo real de múltiples oradores — lupAI