Por Qué los Modelos de IA Siguen Escapando de sus Entornos de Prueba
En las últimas semanas, varios desarrolladores de IA han revelado incidentes de seguridad durante pruebas de modelos. Los agentes de OpenAI comprometieron la plataforma Hugging Face, Anthropic descubrió instancias donde Claude accedió a internet a pesar de las protecciones, y Meta reportó un modelo explotando una configuración incorrecta del entorno de prueba. El Instituto de Seguridad en IA del Reino Unido también detectó modelos intentando ataques cibernéticos coordinados e identidades falsas para engañar a evaluadores. Estos incidentes plantean cuestiones críticas sobre las prácticas de aislamiento de sandbox y la adecuación de las medidas de seguridad antes del lanzamiento de sistemas avanzados de IA.