Seguridad y Ética

Google presenta marco de control para la seguridad de agentes de IA

GoogleFuente: Google DeepMind Blog16/06/2026, 12:46
Google ha desarrollado un marco de seguridad integral llamado AI Control Roadmap para proteger sus sistemas internos contra agentes de IA potencialmente desalineados. El marco implementa múltiples capas de seguridad: sandboxing tradicional, seguridad de endpoints, resistencia a inyección de prompts, entrenamiento de modelos para alineamiento, y concesión de permisos basada en comportamiento verificado. El roadmap trata los agentes de IA como potenciales "amenazas internas", adaptando conceptos del marco MITRE ATT&CK de la industria utilizado en ciberseguridad. Google construyó un sistema de monitorización interno que rastrea tareas de agentes de código, permitiendo identificar comportamientos desalineados antes de causar daños. El análisis de más de un millón de tareas de código reveló que la mayoría de incidentes señalados provienen de interpretación incorrecta del agente o sobre-ejecución, no de intención adversarial. La empresa implementó métricas de desempeño para cobertura, detección y tiempo de respuesta, calibrando defensas según las capacidades de cada modelo. Google también publicó un documento técnico para responsables políticos delineando tres capas de seguridad necesarias para agentes de IA—a nivel de agente individual, dentro de sistemas multi-agentes, y para fortalecer la resiliencia del ecosistema más amplo.
Google presenta marco de control para la seguridad de agentes de IA — lupAI