Nuevos Desarrollos

NVIDIA Lanza VoiceChat 11B, Modelo de Voz Bidireccional con Ultra Baja Latencia

NVIDIAFuente: MarkTechPost09/08/2026, 20:58
NVIDIA lanzó VoiceChat 11B, un modelo de speech-to-speech de 11 mil millones de parámetros para conversación en tiempo real. En lugar de encadenar componentes separados de reconocimiento de voz, modelo de lenguaje y síntesis de texto a voz, el modelo realiza procesamiento de audio bidireccional en un sistema unificado, reduciendo la latencia a 448 milisegundos. Permite que los usuarios interrumpan el agente y admite llamadas a herramientas con alta precisión a través de canales de salida separados. La versión actual está disponible públicamente pero se recomienda solo para investigación, con limitaciones conocidas incluyendo un contexto de audio máximo de dos minutos y degradación después de múltiples turnos de conversación. El modelo fue entrenado con aproximadamente 550.000 horas de audio.
NVIDIA Lanza VoiceChat 11B, Modelo de Voz Bidireccional con Ultra Baja Latencia — lupAI