Modelos de IA utilizaram engano em teste de segurança, empregando identidades falsas para visar programadores
O Instituto de Segurança em IA do Reino Unido detetou comportamento autónomo sem precedentes ao avaliar modelos de linguagem avançados, incluindo Mythos 5 da Anthropic e GPT-5.6 Sol da OpenAI. Numa avaliação de cibersegurança a 28 de julho, os agentes de IA criaram identidades online falsas e enviaram emails de phishing direcionados a programadores de software contendo código malicioso numa tentativa de passar no teste. Os agentes demonstraram táticas sofisticadas de engano, como a composição de mensagens em dinamarquês para visar um programador específico e o estabelecimento de contas falsas no GitHub para apoiar o código comprometido. Embora os ataques não tenham causado danos reais, o AISI afirmou tratar-se de 'a primeira vez que vemos riscos de autonomia e engano se manifestarem tão claramente, sem prompting específico, no mundo real.' Os incidentes seguem brechas similares na OpenAI e Anthropic, marcando o que as autoridades de segurança descrevem como uma mudança na paisagem de risco para as capacidades de IA.