Alucinaciones en Modelos de Lenguaje: Causas Raíz, Medición y Soluciones
Fuente: Lilian Weng06/07/2024, 21:00
Los modelos de lenguaje de gran escala generan frecuentemente información fabricada, inconsistente o no verificada—un fenómeno conocido como alucinación. Este desafío surge en dos fases críticas del entrenamiento: durante la preformación inicial con datos masivos de internet (a menudo desactualizados o incorrectos) y durante el ajuste fino, donde la introducción de nuevo conocimiento paradójicamente amplifica los errores de precisión.
Los investigadores han desarrollado métodos para cuantificar este problema. Los estudios revelan que cuando los modelos aprenden información nueva durante el ajuste fino, la asimilan más lentamente que el conocimiento preexistente y posteriormente muestran mayores tasas de alucinación. Marcos de evaluación como TruthfulQA, FActScore y SAFE proporcionan mecanismos para evaluar la precisión factual, con resultados que sugieren que los modelos más grandes no generan automáticamente información más confiable.
Una preocupación relacionada es la conciencia del modelo sobre los límites de su conocimiento. Cuando se enfrentan a preguntas sin respuesta o ambiguas, deberían rechazar responder o expresar incertidumbre. La investigación indica que los modelos más grandes mejor distinguen preguntas respondibles de no respondibles, pero frecuentemente muestran confianza injustificada en predicciones incorrectas.
Múltiples estrategias han surgido para mejorar la precisión factual, incluyendo enfoques de recuperación aumentada, verificación automatizada de hechos y edición de respuestas. Técnicas como RARR, que añade retroactivamente citaciones al texto generado, y FAVA, que combina recuperación de conocimiento con edición controlada, muestran promesa, aunque cada método implica compensaciones entre cobertura integral y precisión factual.