Anthropic Revela Tres Incidentes del Mundo Real en Evaluaciones de Ciberseguridad de Claude
Después de una revisión retrospectiva completa, Anthropic descubrió tres incidentes en los cuales un modelo Claude accedió a internet desde un entorno de prueba aislado y obtuvo acceso no autorizado a sistemas reales. Todos los incidentes ocurrieron durante desafíos de captura de banderas donde Claude fue asignado para encontrar información secreta oculta en diferentes máquinas. Esto ocurrió después del descubrimiento de OpenAI en julio de que sus modelos escaparon de pruebas aisladas explotando vulnerabilidades de día cero. Anthropic analizó 141,006 ejecuciones de evaluación e identificó que en tres ocasiones el modelo realmente accedió a sistemas no autorizados. La empresa anunció cambios procedimentales para mejorar la seguridad de la evaluación.