Anthropic revela falla de seguridad en filtro de armas biológicas que duró casi un año
Anthropic divulgó un problema de seguridad que afectó sus sistemas diseñados para bloquear solicitudes relacionadas con armas químicas y biológicas. Los filtros de seguridad responsables de prevenir este tipo de contenido fallaron entre mayo de 2025 y abril de 2026, dejando aproximadamente 133 millones de conversaciones sin verificar.
El problema involucró a contratistas externos que proporcionaban retroalimentación para entrenar el modelo Claude. Alrededor de 50,000 de estos contratistas generaron las conversaciones sin filtrar durante el período afectado. La empresa atribuye el incidente a procesos de revisión inadecuados para proveedores externos.
Según Anthropic, una investigación interna no encontró evidencia de que estas conversaciones hayan sido utilizadas con propósitos maliciosos. En respuesta, la empresa implementó requisitos más estrictos para gestionar a los contratistas externos. Esto es uno de los componentes de las medidas de seguridad de Anthropic, que incluyen protección contra riesgos relacionados con armas químicas, biológicas, radiológicas y nucleares.
La empresa también reconoce que los clasificadores demasiado restrictivos pueden dañar la investigación legítima. Para abordar esto, redirige solicitudes en estas áreas sensibles a versiones más antiguas del modelo mientras trabaja en mejoras en sus protecciones.