Investigación y Papers

Transformers en Evolución: Cartografía de Mejoras en Arquitecturas de Atención

Transformer + Transformer-XLFuente: Lilian Weng26/01/2023, 21:00
Una revisión actualizada de las variantes de arquitectura Transformer fue presentada, consolidando los avances reportados en la literatura desde publicaciones anteriores. El trabajo, notablemente expandido, reexamina los conceptos fundamentales a través de investigaciones recientes, trazando la trayectoria de una familia de modelos que transformó el procesamiento del lenguaje natural. El Transformer descansa en mecanismos de atención que permiten identificar información prioritaria dentro de secuencias de datos. Versiones simplificadas del diseño original—incluyendo BERT (solo codificación) y GPT (solo decodificación)—demostraron la versatilidad de la arquitectura en diversos contextos de procesamiento de lenguaje. Componentes fundamentales como la atención multi-cabeza y las representaciones posicionales han recibido refinamientos continuos desde su formulación inicial. La limitación inherente al procesamiento de secuencias largas motivó el desarrollo de múltiples soluciones arquitectónicas. Transformer-XL aborda este desafío mediante un mecanismo de memoria que preserva estados ocultos entre segmentos consecutivos, mientras que Compressive Transformer optimiza esta estrategia comprimiendo activaciones antiguas. Técnicas complementarias como kNN-LM enriquecen las predicciones del modelo al recuperar ejemplos relevantes de repositorios externos, elevando el desempeño general.
Transformers en Evolución: Cartografía de Mejoras en Arquitecturas de Atención — lupAI