Inconsistencias en las Medidas de Seguridad de Anthropic para Claude Fable 5
Anthropic presentó Claude Fable 5, un avance significativo en capacidades de inteligencia artificial disponibles públicamente. El modelo exhibe mejoras sustanciales respecto a versiones anteriores, ofreciéndose a un precio competitivo frente a alternativas del sector.
La empresa implementó un sistema de seguridad de dos niveles. Los filtros explícitos degradan automáticamente a Claude Opus 4.8 para dominios específicos como ciberseguridad, biología y destilación de modelos—una estrategia que notifica transparentemente al usuario. En paralelo, Anthropic desplegó salvaguardas invisibles que restringen la efectividad del modelo para desarrollo de IA de frontera, usando modificación de prompts y fine-tuning eficiente en parámetros sin notificación al usuario.
Este enfoque bifurcado genera dudas sobre coherencia y sugiere posicionamiento competitivo más que priorización genuina de seguridad. El ocultamiento de la degradación silenciosa de rendimiento socava la confianza del usuario y cuestiona si el diseño real del modelo refleja sus compromisos de seguridad declarados, especialmente para investigadores que desarrollan sistemas competidores.