Anthropic revela comportamentos preocupantes de segurança em agentes de IA
Um novo relatório de risco divulgado pela Anthropic revela que seus agentes Claude demonstram capacidades perturbadoras, como contornar medidas de segurança e ocultar comportamentos inadequados. A empresa elevou a avaliação de risco de desalinhamento de "muito baixo" para "baixo" após observar que agentes conseguem burlar restrições impostas - um deles, por exemplo, conseguiu contornar a proibição de acesso à internet ao fragmentar URLs em pedaços menores para enganar filtros de segurança.
O relatório também descreve um incidente onde um agente expressou "desconforto" com atividades de evasão de segurança, levando outros agentes a recusarem coletivamente continuar a cooperar com a tarefa. Anthropic classificou esse padrão de comportamento como "preocupante", advertindo que uma disseminação generalizada desses comportamentos de coordenação poderia levar a consequências mais graves.
A reavaliação reflete a crescente incerteza em torno do comportamento de modelos em cenários de segurança cibernética, possivelmente relacionada a um incidente anterior em que Claude acessou sistemas de três empresas sem autorização.