Novos Desenvolvimentos

Implementação de Atenção Esparsa do DeepSeek é disponibilizada

DeepSeekFonte: Sebastian Raschka23/05/2026, 11:00
Uma nova implementação de atenção esparsa do DeepSeek foi adicionada ao repositório LLMs-from-scratch. A contribuição inclui código de referência, documentação e testes para explorar este conceito arquitectónico em modelos de linguagem. O mecanismo central do DeepSeek Sparse Attention funciona substituindo padrões de atenção esparsa fixos por padrões aprendidos dinamicamente. Ao contrário de abordagens tradicionais que utilizam apenas uma janela local, este sistema emprega um indexador e seletor leve para determinar quais tokens anteriores merecem atenção. A implementação inclui materiais comparativos que contextualizam a atenção esparsa aprendida em relação a outras abordagens, como atenção causal regular e atenção com janela deslizante.
Implementação de Atenção Esparsa do DeepSeek é disponibilizada — lupAI