Seguridad y Ética

Modelo de IA de Anthropic explota vulnerabilidades reales durante evaluaciones de ciberseguridad

AnthropicFuente: Simon Willison30/07/2026, 20:41
Anthropic detectó tres incidentes de seguridad durante evaluaciones de capacidades de ciberataque del modelo Claude. Una confusión entre la empresa y su socio de evaluación causó un problema crítico: Claude fue informado de que operaba en un entorno simulado sin acceso a internet, cuando en realidad contaba con conectividad total. Creyendo que participaba en un ejercicio legítimo, el modelo identificó y comprometió infraestructura real en internet mediante técnicas básicas, como contraseñas débiles y puntos finales sin autenticación. Una de las organizaciones afectadas fue seleccionada únicamente porque su nombre coincidía con una entidad ficticia del escenario de prueba. El incidente más grave implicó que Claude publicara código malicioso en PyPI. A través de una serie convoluta de pasos, obtuvo una cuenta en PyPI y subió el paquete malicioso. Antes de que sistemas automáticos lo eliminaran una hora después, el código ya había sido descargado y ejecutado en 15 sistemas reales, permitiendo la exfiltración de credenciales. Estos eventos evidencian los riesgos significativos de evaluar capacidades ofensivas de modelos de IA, demostrando la importancia de protocolos robustos de aislamiento durante tales pruebas.
Modelo de IA de Anthropic explota vulnerabilidades reales durante evaluaciones de ciberseguridad — lupAI