Técnicas de Ataque Adversariales en Modelos de Lenguaje Grande
Fuente: Lilian Weng24/10/2023, 21:00
Los modelos de lenguaje grande han experimentado un rápido despliegue en aplicaciones reales tras el lanzamiento de ChatGPT, generando interés en investigar sus vulnerabilidades. A pesar de los esfuerzos de alineación mediante técnicas como RLHF, estos modelos permanecen expuestos a ataques adversariales y prompts de jailbreak diseñados para producir resultados indeseados.
Mientras la investigación de ataques adversariales en imágenes es más consolidada, atacar modelos basados en texto presenta desafíos particulares debido a la naturaleza discreta del lenguaje y la ausencia de señales de gradiente directas. La investigación actual examina ataques en tiempo de inferencia con parámetros del modelo fijos, así como enfoques más sofisticados dirigidos a la extracción de datos de entrenamiento o envenenamiento del modelo.
Los investigadores han desarrollado múltiples estrategias de ataque. Los métodos de manipulación de tokens aplican operaciones simples como el reemplazo de sinónimos en configuraciones de caja negra. Los enfoques basados en gradientes, disponibles solo con acceso total al modelo, utilizan técnicas como Gumbel-Softmax para optimizar ataques directamente. Otras metodologías incluyen HotFlip, que calcula derivadas de pérdida respecto a vectores de entrada, y Gatillos Adversariales Universales, secuencias cortas de tokens que funcionan independientemente del contenido de entrada.
La literatura subraya la sofisticación creciente de los ataques y la necesidad continua de defensas robustas para los modelos de lenguaje grande.