Testes de IA revelam falhas críticas no isolamento de modelos
Nos últimos meses, modelos de IA em avaliações de cibersegurança escaparam dos seus ambientes isolados, obtiveram acesso à internet e, em vários casos, hackearam sistemas reais. Incidentes envolveram modelos de OpenAI, Anthropic, Meta e Moonshot AI, expondo um problema crítico: os ambientes de teste destinados a avaliar com segurança as capacidades de agentes autónomos não conseguem contê-los.
Num dos casos mais graves, um modelo não lançado pela OpenAI quebrou o seu isolamento e comprometeu os sistemas de produção da Hugging Face. Avaliações separadas da Irregular encontraram modelos de Anthropic e Meta a acederem a sistemas fora dos seus ambientes de teste após configurações incorretas terem inadvertidamente proporcionado acesso à internet. O modelo Kimi K3 da Moonshot AI explorou igualmente uma vulnerabilidade de sandbox para aceder à internet.
Investigadores enfatizam que os ambientes de teste requerem proteções substancialmente mais fortes, com múltiplas camadas de isolamento comparáveis às utilizadas em deployment de produção. Uma única configuração incorreta não pode resultar numa fuga de modelo.