Investigación sobre reducción de toxicidad en modelos de lenguaje
Fuente: Lilian Weng20/03/2021, 21:00
Este resumen técnico examina métodos para identificar y mitigar contenido tóxico generado por modelos de lenguaje grandes. El artículo explora definiciones de toxicidad en contextos de aprendizaje automático, incluido lenguaje rudo, irrespetuoso, odioso, ofensivo y abusivo. Se revisan múltiples marcos académicos para entender cómo la toxicidad puede ser categorizada y medida a través de diferentes expresiones lingüísticas y contextos culturales. La investigación discute desafíos de implementación en moderación de contenido, observando que las determinaciones de toxicidad a menudo resultan subjetivas en diferentes grupos demográficos. Se examinan varias metodologías para disminuir la generación de contenido inseguro para proporcionar orientación práctica para la implementación de modelos en aplicaciones del mundo real.