Pesquisa & Papers

Pesquisa sobre redução de toxicidade em modelos de linguagem

Fonte: Lilian Weng20/03/2021, 21:00
Este resumo técnico examina métodos para identificar e mitigar conteúdo tóxico gerado por modelos de linguagem grandes. O artigo explora definições de toxicidade em contextos de aprendizado de máquina, incluindo linguagem rude, desrespeitosa, odiosa, ofensiva e abusiva. Múltiplos marcos acadêmicos são revisados para entender como toxicidade pode ser categorizada e medida em diferentes expressões linguísticas e contextos culturais. A pesquisa discute desafios de implementação em moderação de conteúdo, observando que determinações de toxicidade frequentemente se provam subjetivas em diferentes grupos demográficos. Várias metodologias para diminuir a geração de conteúdo inseguro são examinadas para fornecer orientação prática para implantação de modelo em aplicações do mundo real.
Pesquisa sobre redução de toxicidade em modelos de linguagem — lupAI