Métodos de Ataque Adversariais em Modelos de Linguagem Grande
Fonte: Lilian Weng24/10/2023, 21:00
Os modelos de linguagem de grande dimensão ganharam destaque significativo após o lançamento do ChatGPT, impulsionando a adoção em aplicações reais. Apesar dos esforços de alinhamento durante o treino, como o RLHF, estes modelos permanecem vulneráveis a ataques adversariais ou prompts de jailbreak que podem levar a respostas indesejadas.
Enquanto a investigação de ataques adversariais em imagens é mais madura, os ataques em dados discretos como texto colocam desafios únicos. A investigação recente foca em dois cenários: ataques em tempo de inferência com pesos do modelo fixos, e ataques mais sofisticados dirigidos à extração de dados de treino ou envenenamento de dados.
Existem várias abordagens para encontrar entradas que desencadeiem comportamentos indesejados. As técnicas de manipulação de tokens aplicam operações simples como substituição por sinónimos. Métodos baseados em gradientes, viáveis apenas em configurações de acesso total ao modelo, usam truques como Gumbel-Softmax para otimizar ataques diretamente. Outras estratégias incluem HotFlip, que mede derivadas em relação a vetores de entrada, e Gatilhos Adversariais Universais, sequências de tokens curtas que funcionam independentemente da entrada.
A pesquisa destaca a crescente sofisticação das técnicas de ataque e a necessidade contínua de defesas robustas para modelos de linguagem.