Investigación y Papers

Generando datos de entrenamiento: técnicas de aumento y síntesis cuando los datos escasean

BERT + GPT-3Fuente: Lilian Weng15/04/2022, 19:10
Ante volúmenes limitados de datos de entrenamiento, dos estrategias complementarias resultan efectivas: el aumento de datos, que modifica ejemplos existentes preservando su significado, y la síntesis de datos, que genera nuevos ejemplos artificialmente. El aumento opera mediante transformaciones controladas en imágenes, texto, audio y representaciones internas de modelos, modificando atributos no esenciales manteniendo la integridad semántica. El aumento de texto emplea operaciones simples pero potentes: reemplazo de palabras, inserción, intercambio y eliminación, con mejoras más pronunciadas en conjuntos pequeños. Enfoques sofisticados aprovechan modelos de lenguaje pre-entrenados que reemplazan palabras con sinónimos semánticamente adecuados, o crean nuevos textos traduciendo entre idiomas. El aumento de audio enmascara segmentos temporales o de frecuencia, aplica cambios de pitch y mezcla múltiples muestras. La síntesis basada en modelos de lenguaje ofrece una alternativa escalable. La investigación demuestra que GPT-3 puede anotar datos a aproximadamente una décima parte del costo del etiquetado humano, funcionando como anotador débil dentro de marcos de auto-entrenamiento. Los modelos ajustados pueden generar similarmente muestras sintéticas condicionadas por etiquetas, proceso que se itera a través del tiempo. Los datos generados contienen típicamente ruido e inexactitudes, lo que requiere técnicas de entrenamiento robusto. La regularización estándar como dropout y normalización por lotes ayuda, al igual que métodos especializados que filtran ejemplos comprometidos durante el entrenamiento o adaptan predicciones del modelo para coincidir con patrones de ruido observados. El desempeño final depende de afinidad (relevancia para la tarea) y diversidad (cobertura en el espacio de datos).
Generando datos de entrenamiento: técnicas de aumento y síntesis cuando los datos escasean — lupAI