Seguridad y Ética

Investigadores revelan vulnerabilidad en reasoning traces de modelos de IA

Anthropic + OpenAIFuente: Simon Willison, Wired - AI11/08/2026, 19:40
Investigadores descubrieron una vulnerabilidad crítica donde bloques de razonamiento cifrados devueltos por modelos frontier de Anthropic, OpenAI y Google pueden ser extraídos en formato legible. La técnica implica repetir los bloques cifrados a modelos más débiles de la misma familia para quebrantar y recuperar el razonamiento oculto en plaintext. Claude Haiku 4.5 resultó especialmente vulnerable con un prompt específico. Todos los proveedores fueron notificados e implementaron correcciones, dejando modelos posteriores protegidos contra este ataque.
Investigadores revelan vulnerabilidad en reasoning traces de modelos de IA — lupAI