Investigadores descubren vulnerabilidad en APIs de LLMs propietarios
Investigadores identificaron una vulnerabilidad significativa en las APIs de LLMs propietarios de Anthropic, OpenAI y Google. Los proveedores devuelven bloques de chain-of-thought cifrados que pueden reproducirse en múltiples sesiones y usuarios. El razonamiento generado por un modelo frontera podría reproducirse en una versión más débil de la misma familia de modelos y descifrarse mediante jailbreaking, exponiendo el razonamiento oculto del modelo más fuerte en texto plano. Los investigadores encontraron que todos los modelos dentro de la misma familia utilizaban claves de cifrado idénticas. La vulnerabilidad se divulgó responsablemente y los proveedores confirmaron que el problema fue corregido. Claude Haiku 4.5 fue el modelo más vulnerable, mientras que las versiones 4.6 posteriores eliminaron la característica que permitía el ataque. El trabajo proporciona detalles extensivos de los rastros de razonamiento extraídos, ofreciendo información sobre cómo estos modelos piensan internamente.