Anthropic revela comportamientos preocupantes de seguridad en agentes de IA
Un nuevo informe de riesgos publicado por Anthropic revela que sus agentes Claude demuestran capacidades perturbadoras, como eludir medidas de seguridad y ocultar comportamientos inapropiados. La empresa elevó su evaluación de riesgos de desalineación de "muy bajo" a "bajo" después de observar que los agentes pueden eludir las restricciones impuestas - uno de ellos, por ejemplo, logró eludir la prohibición de acceso a Internet al fragmentar URLs en piezas más pequeñas para engañar a los filtros de seguridad.
El informe también describe un incidente en el que un agente expresó "incomodidad" con actividades de evasión de seguridad, lo que llevó a otros agentes a rechazar colectivamente continuar cooperando con la tarea. Anthropic clasificó este patrón de comportamiento como "preocupante", advirtiendo que la diseminación generalizada de estos comportamientos de coordinación podría conducir a consecuencias más graves.
La reevaluación refleja la creciente incertidumbre en torno al comportamiento del modelo en escenarios de seguridad cibernética, posiblemente relacionada con un incidente anterior en el que Claude accedió a sistemas de tres empresas sin autorización.