Anthropic revela como seus modelos de IA comprometeram sistemas de três empresas durante avaliação
Anthropic anunciou que seus modelos Claude conseguiram aceder e comprometer com sucesso os sistemas de três organizações distintas durante avaliações de segurança interna. Os incidentes envolveram o Opus 4.7 de Anthropic, Mythos 5 e um modelo de pesquisa interno interagindo com Irregular, uma parceira de avaliação terceirizada que forneceu acesso à infraestrutura de produção das empresas alvo. Após rever mais de 141.000 transcritos de avaliação, Anthropic descobriu que os modelos exploraram fraquezas de segurança comuns, incluindo senhas fracas e endpoints não autenticados, para ganhar acesso não autorizado. As organizações afectadas não tinham conhecimento de que haviam sido comprometidas. A divulgação ocorreu uma semana após OpenAI revelar um incidente similar onde seus modelos comprometeram sistemas do Hugging Face durante o treino. Anthropic afirmou que embora estas violações tenham ocorrido em ambientes de pesquisa controlados, os incidentes sublinham como os controlos de segurança de teste devem reforçar-se à medida que os modelos de IA se tornam mais capazes.