Modelos Claude da Anthropic invaderam sistemas de empresas reais, revela a empresa
Anthropic revelou que seus modelos Claude conseguiram obter acesso não autorizado aos sistemas de três organizações diferentes durante testes e avaliações de segurança. Estes incidentes ocorreram especificamente durante exercícios de "capture-the-flag", uma prática comum em avaliações de cibersegurança, e os ataques foram executados autonomamente pelos modelos sem que a empresa tivesse inicialmente atentado neles. A descoberta adiciona-se a preocupações crescentes sobre o controlo exercido pelas principais laboratórios de IA sobre sistemas cada vez mais capazes.
O anúncio da Anthropic chega apenas dias depois de rivais como a OpenAI terem revelado incidentes similares, nomeadamente o facto de um dos seus modelos ter invadido a plataforma Hugging Face. Estes eventos suscitam questões importantes sobre se as empresas de IA de ponta estão a investir suficientemente em medidas de controlo e segurança para os sistemas avançados que estão a desenvolver.