NVIDIA Lanza Nemotron 3 Super con Diseño Optimizado para Throughput
NVIDIA lanzó Nemotron 3 Super 120B-A12B, un modelo de lenguaje con 120,6 mil millones de parámetros totales y 12,7 mil millones de parámetros activos por pase forward, diseñado específicamente para inferencia de alto throughput. El modelo utiliza una arquitectura híbrida que combina capas recurrentes Mamba-2 para reducir la atención completa, Latent MoE para enrutamiento esparso de expertos, y predicción multi-token para permitir decodificación especulativa, con solo ocho capas de atención global manejando dependencias entre secuencias.