Entendiendo los Modelos de Difusión
Fuente: Lilian Weng10/07/2021, 21:00
Los modelos de difusión representan un enfoque alternativo a la generación de datos en comparación con métodos convencionales como GANs y VAEs, ofreciendo entrenamiento más estable y mayor diversidad en las muestras generadas. Inspirados en conceptos de termodinámica no-equilibrio, estos modelos aprenden a invertir un proceso de difusión que añade progresivamente ruído gaussiano a los datos hasta transformarlos en ruído puro.
El funcionamiento se divide en dos fases distintas. Primero, el modelo añade iterativamente ruído a los datos originales mediante T pasos controlados por un calendario de varianza. Segundo, una red neuronal aprende a revertir este proceso, comenzando desde ruído puro e iterativamente removiendo ruído para reconstruir muestras coherentes. Una propiedad matemática fundamental permite muestrear cualquier estado intermedio directamente sin necesidad de ejecutar todos los pasos anteriores.
El entrenamiento optimiza redes neuronales para predecir el ruído añadido en cada etapa o estimar el gradiente de la distribución de datos. Las mejoras recientes incluyen calendarios de varianza basados en coseno, aprendizaje condicional de varianza e incorporación de información de clase o texto para generación controlada. Variantes específicas como DDPM, GLIDE, Imagen y diffusion latente demuestran la versatilidad del enfoque en diferentes aplicaciones.