Patches de IA Ainda Insuficientes: Mais da Metade dos Reparos Gerados Falham
Novas pesquisas examinando a capacidade da IA em corrigir vulnerabilidades de segurança expuseram limitações significativas nos modelos atuais, levantando preocupações sobre depender de IA generativa para trabalhos críticos de cibersegurança. Pesquisadores da 1Password testaram ChatGPT 5.5 da OpenAI e Claude Opus 4.8 da Anthropic contra seis vulnerabilidades comuns de alta complexidade, descobrindo que ambos os modelos alcançaram uma taxa de sucesso abaixo de 50% na resolução completa de vulnerabilidades sem introduzir novos problemas. Um estudo paralelo da Veracode em 100 modelos encontrou problemas similares, com aproximadamente 44% dos testes resultando em modelos introduzindo inadvertidamente vulnerabilidades exploráveis do OWASP Top 10. Enquanto modelos mais avançados como Mythos da Anthropic e GPT-5.6-Sol da OpenAI supostamente mostram capacidades melhoradas de cibersegurança e estão sendo distribuídos através das iniciativas Project Glasswing e Daybreak, estes ainda não foram testados independentemente, deixando questões sobre sua eficácia prática para patching autônomo em larga escala.