Mistral Lança Shieldstral: Um Classificador de Segurança Aberto para Moderação de Conteúdo em IA
O laboratório de IA francês Mistral apresentou o Shieldstral na terça-feira, um classificador de segurança multimodal de três bilhões de parâmetros projetado para simplificar as salvaguardas de segurança de IA. Ao contrário de modelos tradicionais que exigem retreinamento para atualizar políticas de segurança, o Shieldstral aceita instruções em linguagem natural no tempo de inferência, permitindo que os usuários definam políticas de segurança personalizadas sem retreinamento do modelo. O sistema produz uma pontuação de segurança contínua em vez de verificações binárias, dando aos deployadores controle mais granular sobre limiares de risco. Mistral afirma que o modelo corresponde ao desempenho do GPT-OSS-Safeguard da OpenAI, um modelo de vinte bilhões de parâmetros, em benchmarks de segurança de texto enquanto funciona com apenas 16GB de memória GPU, reduzindo significativamente os custos computacionais. Lançado como open-weight sob licença Apache 2.0, o Shieldstral reflete a estratégia da Mistral de construir ferramentas práticas em toda a stack de IA em vez de focar apenas no desenvolvimento de modelos de fronteira. O movimento se alinha com a recente adesão da empresa à Open Secure AI Alliance, uma coalizão recém-lançada focada em ferramentas de segurança de código aberto.