Mistral Lanza Clasificador de Seguridad Shieldstral 1.0 3B para Moderación Flexible de Contenido
Mistral AI ha lanzado Shieldstral 1.0 3B, un clasificador de seguridad multimodal de pesos abiertos diseñado para moderación flexible de contenido. A diferencia de los sistemas de seguridad tradicionales que integran categorías de daño fijas en los pesos, Shieldstral acepta políticas como preguntas en lenguaje natural en el momento de la inferencia y devuelve puntuaciones de seguridad calibradas. El modelo de 3B, construido sobre Ministral-3-3B-Base con un codificador de visión Pixtral nativo, logra una puntuación F1 promedio de 84,9% en seguridad de texto, igualando modelos más grandes como GPT-OSS-Safeguard-20B, y 83,8% en seguridad multimodal. El modelo se ejecuta localmente en una única GPU con 16GB de VRAM en precisión BF16 y está licenciado bajo Apache 2.0 para uso comercial. El entrenamiento aprovechó 54,1M muestras incluyendo texto de código abierto, datos contrastivos sintéticos generados reescribiendo texto seguro en variantes de riesgo dirigidas y contenido multimodal. La infraestructura de servicio ya está integrada con vLLM, llama.cpp, SGLang y Transformers.