Aprendizaje con Datos Etiquetados Limitados: Métodos de Aprendizaje Semi-Supervisado
Fuente: Lilian Weng04/12/2021, 21:00
Un artículo educativo introduce la primera parte de una serie sobre aprendizaje automático con datos etiquetados escasos, enfocándose en aprendizaje semi-supervisado. El enfoque combina datos etiquetados y sin etiquetar para entrenar modelos, fundamentado en cuatro suposiciones teóricas: muestras cercanas en el espacio de características deben compartir etiquetas similares, los datos forman naturalmente clusters densos con etiquetas consistentes, los límites de decisión existen en regiones dispersas, y los datos de alta dimensionalidad residen en variedades de menor dimensionalidad.
El texto revisa técnicas de regularización por consistencia como Π-Model y Temporal Ensembling, que imponen predicciones estables a través de múltiples pasadas por la red. Mean Teacher mejora la eficiencia manteniendo un promedio móvil exponencial de los pesos del modelo, demostrando precisión superior comparado con Π-Model. Métodos posteriores como Virtual Adversarial Training, Interpolation Consistency Training y Unsupervised Data Augmentation extienden estos conceptos mediante perturbaciones adversariales y estrategias de aumento sofisticadas, investigando cómo la calidad del ruido afecta el desempeño.
Técnicas de pseudo-etiquetado aprovechan predicciones de modelo para etiquetar datos sin etiquetar, funcionando de manera equivalente a regularización por entropía. Label Propagation construye gráficos de similitud para distribuir etiquetas entre muestras sin etiquetar. Enfoques recientes de auto-entrenamiento, ejemplificados por Noisy Student, demostraron escalabilidad extrema al entrenar EfficientNet en 300 millones de imágenes sin etiquetar, combinando ruido en el entrenamiento del estudiante con predicciones limpias del maestro.