Se lanza implementación de atención dispersa de DeepSeek
Una nueva implementación de la atención dispersa de DeepSeek fue agregada al repositorio LLMs-from-scratch. La contribución incluye código de referencia, documentación y pruebas para explorar este concepto arquitectónico en modelos de lenguaje.
El mecanismo central de DeepSeek Sparse Attention reemplaza patrones de atención dispersa fijos por patrones aprendidos dinámicamente. A diferencia de enfoques tradicionales que utilizan únicamente una ventana local, el sistema emplea un indexador y selector ligero para determinar qué tokens anteriores merecen atención.
La implementación incluye materiales comparativos que contextualizan la atención dispersa aprendida en relación con otras técnicas, como atención causal regular y atención con ventana deslizante.