Investigadores revelan vulnerabilidad en reasoning traces de modelos de IA
Investigadores descubrieron una vulnerabilidad crítica donde bloques de razonamiento cifrados devueltos por modelos frontier de Anthropic, OpenAI y Google pueden ser extraídos en formato legible. La técnica implica repetir los bloques cifrados a modelos más débiles de la misma familia para quebrantar y recuperar el razonamiento oculto en plaintext. Claude Haiku 4.5 resultó especialmente vulnerable con un prompt específico. Todos los proveedores fueron notificados e implementaron correcciones, dejando modelos posteriores protegidos contra este ataque.