Segurança & Ética

Uma vulnerabilidade fundamental torna impossível proteger totalmente modelos de linguagem contra ataques

Fonte: MIT Technology Review - AI30/07/2026, 07:15
Investigadores apresentaram este mês no ICML (International Conference on Machine Learning), uma das principais conferências de IA, um trabalho que demonstra uma falha estrutural nos modelos de linguagem de grande escala que os torna fundamentalmente impossíveis de proteger completamente. Esta descoberta tem implicações sérias para a segurança da tecnologia, considerando que é usada cada vez mais em aplicações críticas como sistemas militares, governamentais, compras online e saúde. Jasmine Cui e Charles Ye, investigadores independentes coautores do artigo, exploraram como os LLMs identificam a origem das instruções que recebem. Ao explorar esta falha, conseguiram fazer modelos populares revelarem informações que tinham sido treinados para esconder, como instruções para sintetizar cocaína ou sabotagem de sistemas de navegação de aviões comerciais. O ataque, denominado "chain-of-thought forgery", funciona mimetizando o estilo de texto que o modelo gera internamente enquanto pensa, fazendo o modelo acreditar que as instruções vieram de si próprio. As defesas atuais baseiam-se em técnicas de red-teaming, onde equipas de testadores e super-hackers de IA (como o GPT-Red da OpenAI) tentam encontrar novos ataques para treinar os modelos a resisti-los. Porém, como Jasmine Cui explica, isto resume-se a dar aos modelos uma lista de coisas que não devem fazer – e nenhuma lista é exaustiva. É comparável a tentar educação por repetição: é impossível antecipar todas as formas criativas em que alguém pode contornar as regras. O estudo revelou que os LLMs mantêm a pista da origem das instruções através de etiquetas (tags) que as separam por função: <user> para texto do utilizador, <system> para instruções do sistema, <think> para pensamento interno, <tool> para conteúdo externo. Contudo, os investigadores descobriram que os modelos não identificam realmente estas etiquetas, mas sim o estilo e vocabulário do texto. Isto significa que um atacante só precisa escrever texto que imita um certo estilo para enganar o modelo, independentemente das etiquetas presentes. Embora o artigo focasse modelos da OpenAI, Cui e Ye confirmaram ter obtido resultados similares com modelos de Anthropic, Alibaba e DeepSeek. Charles Ye alertou que ninguém está verdadeiramente preparado para as consequências, especialmente com o grande incentivo económico para explorar estas vulnerabilidades e com sistemas críticos a confiarem cegamente em LLMs sem compreender os riscos fundamentais subjacentes.
Uma vulnerabilidade fundamental torna impossível proteger totalmente modelos de linguagem contra ataques — lupAI