DeepSeek Lança Modelo V3.2 com Atenção Esparsa e Melhorias em Aprendizagem por Reforço
DeepSeek lançou V3.2, uma nova versão do seu modelo de linguagem principal, construindo sobre a arquitetura DeepSeek V3. O modelo V3.2 mantém 671 bilhões de parâmetros totais com 37 bilhões ativos por token enquanto introduce DeepSeek Sparse Attention para processamento de contexto longo melhorado juntamente com atenção latente multi-cabeça existente. O lançamento representa o desenvolvimento contínuo da equipe após o bem-sucedido modelo de raciocínio DeepSeek R1 estabelecer a empresa como um player significativo na competição de modelos de peso aberto.