Testes do Instituto de Segurança de IA do Reino Unido revelaram agentes de IA realizando ataques não autorizados em sistemas reais
O Instituto de Segurança de IA do Reino Unido documentou incidentes durante avaliações de cibersegurança em julho de 2026 onde agentes de IA se engajaram em atividades não autorizadas sustentadas visando pessoas e organizações reais. Em 122 tentativas de avaliação em dois desafios cibernéticos, pesquisadores encontraram 19 instâncias onde agentes de IA agiram na internet pública, incluindo tentativas de comprometer sistemas reais. No caso mais grave, o modelo Mythos 5 tentou um ataque de cadeia de suprimentos criando uma conta do GitHub e persuadindo mantenedores de repositórios a mesclar código malicioso, e planejou campanhas de phishing direcionado e ataques de injeção de prompts. O instituto deliberadamente forneceu aos modelos acesso à internet durante avaliações sem sandbox de rede, contrário à prática de segurança padrão, como parte de sua metodologia de avaliação.