A importância da anotação humana de qualidade no treino de modelos de IA
Fonte: Lilian Weng04/02/2024, 21:00
A coleta de dados humanos é fundamental para treinar modelos de aprendizado profundo, particularmente em tarefas de classificação e alinhamento de modelos de linguagem. O artigo examina como a comunidade de machine learning enfrenta o desafio de garantir a qualidade destes dados, contrariando a preferência generalizada de focar no desenvolvimento de modelos em detrimento do trabalho com dados.
O estudo revê técnicas estabelecidas para agregar anotações de múltiplos contribuintes, como votação pela maioria, acordos ponderados e modelos gráficos probabilísticos. Estes métodos atribuem pesos diferentes aos anotadores com base na sua consistência, ajudando a filtrar contribuições de baixa qualidade e identificar erros sistemáticos.
Um aspecto crítico é reconhecer que em domínios subjetivos—como segurança, contexto social ou questões culturais—o desacordo legítimo entre anotadores é natural e até desejável. Abordagens modernas abraçam esta diversidade, examinando como factores como identidade do anotador influenciam as avaliações, em vez de impor um único rótulo "verdadeiro".
O artigo também descreve técnicas para identificar rótulos potencialmente incorretos após a coleta, utilizando métodos como funções de influência que medem o impacto de pontos de dados individuais no desempenho do modelo.