Investigación y Papers

Modelos de Lenguaje Visual Generalizados: Diversidad de Enfoques Arquitectónicos

Fuente: Lilian Weng09/06/2022, 19:10
Las tareas de visión-lenguaje, como la descripción automática de imágenes y la respuesta a preguntas visuales, han evolucionado más allá de las tuberías tradicionales de detección de objetos. La investigación reciente se ha centrado en extender modelos de lenguaje preentrenados para procesar señales visuales, generando varias familias arquitectónicas distintas. El primer enfoque principal trata las regiones de imagen como fichas dentro del procesamiento de secuencias. VisualBERT fusiona imágenes y texto mediante el mecanismo de autoatención de BERT, descubriendo alineación transmodal. SimVLM emplea un modelo de lenguaje prefijo donde los tokens visuales se procesan bidireccionalmente antes de la generación de texto. CM3 escala esto aún más, entrenando en datos web masivos para generar resultados multimodales estructurados y ricos, incluidos hipervínculos e imágenes. Una estrategia complementaria mantiene los modelos de lenguaje congelados y adapta únicamente la codificación visual. Frozen y ClipCap ejemplifican este enfoque centrado en la eficiencia, traduciendo incrustaciones visuales al espacio semántico del modelo de lenguaje con entrenamiento mínimo de parámetros. ClipCap específicamente aprovecha incrustaciones de imagen CLIP y demuestra un rendimiento competitivo a pesar de entrenar solo una red de mapeo ligera. Los mecanismos de atención cruzada ofrecen otro camino para equilibrar información visual y lingüística. VisualGPT introduce unidades de activación controladas por puertas para controlar la mezcla de características visuales y lingüísticas; VC-GPT añade capas de atención cruzada entre transformers visuales y decodificadores de lenguaje. Modelos más recientes como MERLOT incorporan razonamiento temporal aprendiendo de videos, mientras que Flamingo representa una síntesis avanzada, aceptando secuencias imagen-texto intercaladas y utilizando compresión basada en Perceiver para fusión multimodal eficiente.
Modelos de Lenguaje Visual Generalizados: Diversidad de Enfoques Arquitectónicos — lupAI