Tutoriales y Guías

Aprendizaje con Datos Etiquetados Limitados: Métodos de Aprendizaje Semi-Supervisado

Fuente: Lilian Weng04/12/2021, 21:00
Un artículo educativo introduce la primera parte de una serie sobre aprendizaje automático con datos etiquetados escasos, enfocándose en aprendizaje semi-supervisado. El enfoque combina datos etiquetados y sin etiquetar para entrenar modelos, fundamentado en cuatro suposiciones teóricas: muestras cercanas en el espacio de características deben compartir etiquetas similares, los datos forman naturalmente clusters densos con etiquetas consistentes, los límites de decisión existen en regiones dispersas, y los datos de alta dimensionalidad residen en variedades de menor dimensionalidad. El texto revisa técnicas de regularización por consistencia como Π-Model y Temporal Ensembling, que imponen predicciones estables a través de múltiples pasadas por la red. Mean Teacher mejora la eficiencia manteniendo un promedio móvil exponencial de los pesos del modelo, demostrando precisión superior comparado con Π-Model. Métodos posteriores como Virtual Adversarial Training, Interpolation Consistency Training y Unsupervised Data Augmentation extienden estos conceptos mediante perturbaciones adversariales y estrategias de aumento sofisticadas, investigando cómo la calidad del ruido afecta el desempeño. Técnicas de pseudo-etiquetado aprovechan predicciones de modelo para etiquetar datos sin etiquetar, funcionando de manera equivalente a regularización por entropía. Label Propagation construye gráficos de similitud para distribuir etiquetas entre muestras sin etiquetar. Enfoques recientes de auto-entrenamiento, ejemplificados por Noisy Student, demostraron escalabilidad extrema al entrenar EfficientNet en 300 millones de imágenes sin etiquetar, combinando ruido en el entrenamiento del estudiante con predicciones limpias del maestro.
Aprendizaje con Datos Etiquetados Limitados: Métodos de Aprendizaje Semi-Supervisado — lupAI