Novos Desenvolvimentos

AMD lança Instella-MoE, modelo MoE aberto de 16B parâmetros treinado em GPUs Instinct

AMD + Instella-MoE-16B-A3BFonte: MarkTechPost01/08/2026, 16:01
A AMD divulgou Instella-MoE-16B-A3B, um modelo Mixture-of-Experts totalmente aberto treinado do zero em GPUs Instinct MI300X e MI325X. Com 16 mil milhões de parâmetros totais, o modelo ativa apenas 2.8 mil milhões por token. A AMD está publicando pesos de cada etapa de treino, junto com misturas de dados, configurações de treino e código de inferência, sob licença ResearchRAIL para fins académicos e de pesquisa. O modelo apresenta duas escolhas estruturais significativas. Gated Multi-head Latent Attention adiciona um gate de saída aprendido à atenção latente multi-cabeça, melhorando a modulação de saída. FarSkip-Collective passa ativações desatualizadas e parciais nas camadas MoE e atenção, sobrepondo comunicação paralela de especialistas com computação. A AMD relata aceleração de pré-treino de 12.7% e redução de até 39.2% no tempo para primeiro token ao servir com paralelismo de especialistas. O pré-treino abrangeu 7.1 triliões de tokens de corpora abertas, seguido de etapa de contexto longo estendendo a janela de 4K para 64K tokens. Pós-treino inclui SFT, DPO e RL no framework Miles, alcançando pontuação média de 76.7 em benchmarks de base, acima de modelos abertos como Moonlight e SmolLM3.
AMD lança Instella-MoE, modelo MoE aberto de 16B parâmetros treinado em GPUs Instinct — lupAI