NVIDIA apresenta Nemotron 3 Ultra, modelo de grande escala com otimização Latent MoE
A NVIDIA divulgou o Nemotron 3 Ultra, um modelo de linguagem de código aberto de grande escala que procura otimizar a relação entre desempenho e eficiência computacional. Com 550 mil milhões de parâmetros totais e 55 mil milhões ativos por token, o modelo segue a arquitetura híbrida Mamba-Transformer MoE já presente na série Nemotron.
A inovação central do Nemotron 3 Ultra é a implementação da técnica Latent MoE, que projeta os experts em operação para um espaço de dimensão reduzida antes de processar, e depois expande o resultado. Este método permite manter a mesma taxa de compressão (4 vezes) enquanto escala o modelo para dimensões muito maiores.
O modelo integra várias estratégias de eficiência além de Latent MoE: Mamba-2, GQA e MTP. De acordo com benchmarks do Artificial Analysis de junho de 2026, o modelo oferece um perfil de desempenho relevante para modelos de sua escala. Os detalhes técnicos completos estão disponíveis no relatório oficial da NVIDIA.