Aprendizaje Activo: Selección Estratégica de Datos Con Presupuesto Limitado
Fuente: Lilian Weng19/02/2022, 21:00
El aprendizaje activo es una técnica de machine learning que permite a los modelos seleccionar estratégicamente qué ejemplos de datos sin etiquetar deben ser anotados manualmente cuando los presupuestos de etiquetado son limitados. Este enfoque resulta particularmente valioso en escenarios donde la anotación de datos es costosa, como en el análisis de imágenes médicas.
El método identifica los ejemplos más valiosos mediante varias estrategias de muestreo. El muestreo por incertidumbre prioriza ejemplos donde los modelos expresan menor confianza en sus predicciones. Los enfoques centrados en diversidad buscan ejemplos que representen mejor la distribución general de los datos. Otras estrategias incluyen Query-By-Committee, que aprovecha múltiples modelos para evaluar consenso, y métodos basados en el cambio esperado del modelo.
Técnicas avanzadas como MC Dropout aproximan la inferencia bayesiana utilizando dropout para estimar la incertidumbre del modelo. DBAL combina esto con redes neuronales bayesianas. Enfoques más recientes como VAAL emplean arquitecturas generativas adversariales, mientras que MAL introduce un marco minimax que reduce la brecha de distribución entre datos etiquetados y sin etiquetar. Métodos complementarios como CAL y selección de core-set se enfocan en ejemplos contrastivos y aproximaciones geométricas.
Los resultados experimentales demuestran que estas técnicas superan los baselines aleatorios en varias tareas de clasificación y segmentación de imágenes, ofreciendo una alternativa rentable para entrenar modelos con datos limitados.