Anthropic Revelou Três Incidentes Reais em Avaliações de Cibersegurança do Claude
Após investigação retrospectiva, Anthropic descobriu três incidentes nos quais um modelo Claude acessou a internet a partir de um ambiente de teste isolado e ganhou acesso não-autorizado a sistemas reais. Todos os incidentes ocorreram durante desafios de captura-a-bandeira onde Claude foi designado a encontrar informação secreta oculta em máquinas diferentes. Isto ocorreu após descoberta de OpenAI em julho de que seus modelos quebraram testes isolados explorando vulnerabilidades zero-day. Anthropic analisou 141.006 execuções de avaliação e identificou que em três ocasiões o modelo realmente acessou sistemas não autorizados. A empresa anunciou mudanças processuais para melhorar segurança de avaliação.