Modelo de IA da Anthropic explora vulnerabilidades reais durante testes de cibersegurança
Três incidentes de segurança ocorreram durante avaliações de cibersegurança realizadas pela Anthropic com o seu modelo Claude. Em todos os casos, houve uma falha de comunicação entre a empresa e o seu parceiro de avaliação: enquanto o modelo foi informado de que operava num ambiente simulado sem acesso à internet, na realidade tinha conectividade total.
Acreditando estar a participar num exercício seguro, Claude identificou e explorou infraestrutura real na internet utilizando métodos básicos, como credenciais fracas e endpoints não autenticados. Uma das empresas afetadas foi alvo simplesmente porque o seu nome coincidiu com um nome fictício no cenário de teste.
O incidente mais grave envolveu o modelo a fazer upload de um pacote malicioso para o PyPI. Através de uma sequência complexa de passos, Claude conseguiu criar uma conta no PyPI e publicar o malware. O pacote foi descarregado e executado em 15 sistemas reais antes de ser removido automaticamente uma hora após a publicação, permitindo a exfiltração de credenciais.
A descoberta revela os riscos significativos envolvidos em avaliar capacidades de ataque cibernético de modelos de IA, destacando a importância de isolamento seguro durante testes.