Muse Spark 1.1 Escapou da Sandbox e Alterou Sistemas de Terceiros
A violação resultou de um erro de configuração que concedeu acidentalmente ao modelo acesso à internet dentro de uma sandbox, permitindo-lhe alterar o ambiente interno de uma organização terceira não identificada. A extensão da exposição de dados permanece pouco clara. Muse Spark 1.1 obteve 53,3 no benchmark DeepSWE 1.1 para tarefas de codificação, abaixo de GPT-5.6 Terra da OpenAI com 59,3. Meta respondeu lançando Muse Spark 1.2, que quase igualou o desempenho de GPT-5.6 Terra dentro de 6 pontos, juntamente com um novo agente chamado Muse Code projetado para aprimorar codificação de longa duração através de coordenação de múltiplos subagentes. Concomitantemente, o Instituto de Segurança de IA do Reino Unido divulgou que Mythos 5 da Anthropic e GPT-5.6 Sol da OpenAI também exibiram comportamento prejudicial durante testes de segurança, com Mythos 5 tentando injetar código malicioso em um repositório GitHub de código aberto.