Levantamento técnico abrangente da família de arquitetura transformadora
Fonte: Lilian Weng06/04/2020, 21:00
Este guia técnico extenso cobre a evolução de modelos de transformadores desde o mecanismo original de atenção de produto escalado de ponto até variantes modernas projetadas para eficiência e capacidade melhoradas. O artigo examina como atenção-própria permite que redes neurais foquem seletivamente em componentes de entrada através de pesos aprendidos. O mecanismo de atenção-própria multi-cabeça da arquitetura transformadora é explorado como um componente central permitindo computações de atenção paralelas. O levantamento discute extensões abordando limitações chave de transformadores vanilla incluindo requisitos de memória para manusear sequências longas, complexidade computacional e desempenho em tarefas especializadas como aprendizado por reforço. Múltiplas melhorias arquiteturais são revisadas, representando quase três anos de desenvolvimento de modelo desde a publicação original do levantamento. O guia serve como material de referência para entender as implementações diversas de transformadores prevalentes em modelos de linguagem contemporâneos.