Segurança & Ética

Pesquisadores revelam vulnerabilidade em reasoning traces de modelos de IA

Anthropic + OpenAIFonte: Simon Willison, Wired - AI11/08/2026, 19:40
Pesquisadores descobriram uma vulnerabilidade crítica onde blocos de raciocínio criptografados retornados por modelos frontier de Anthropic, OpenAI e Google podem ser extraídos em formato legível. A técnica envolve repassar os blocos criptografados a modelos mais fracos da mesma família para jailbreakear e recuperar o raciocínio oculto em plaintext. Claude Haiku 4.5 mostrou-se especialmente vulnerável com um prompt específico. Todos os provedores foram notificados e implementaram correções, deixando os modelos posteriores protegidos contra este ataque.
Pesquisadores revelam vulnerabilidade em reasoning traces de modelos de IA — lupAI