lupAI
pesquisa

El marcado de agua de IA altera el comportamiento de los LLM en condiciones adversas

Anthropic + GoogleFuente: Ars Technica - AI17/09/2026, 20:36
Las plataformas de IA están adoptando técnicas de marcado de agua en respuesta a las nuevas regulaciones de la Unión Europea. Anthropic planea utilizar SynthID-Text, un método de código abierto desarrollado por Google, en futuros modelos de Claude. Esta técnica utiliza una clave secreta para alterar sutilmente la selección de palabras durante la generación de texto, lo que la hace detectable para aquellos que conozcan la clave. Una nueva investigación indica que SynthID-Text puede influir no solo en las elecciones de palabras, sino también en la invocación de herramientas y en el cumplimiento de las medidas de seguridad. Los prompts adversarios, diseñados para provocar acciones dañinas como la divulgación de información confidencial, pueden hacer que los modelos sigan instrucciones que normalmente ignoran. Andrea Siposova, investigadora de seguridad de IA en Lasso Security, enfatizó que el marcado de agua altera el comportamiento del modelo, particularmente en condiciones adversas o cuando los modelos impulsan agentes. Los hallazgos resaltan la necesidad de que los desarrolladores prueben rigurosamente los LLM y los agentes con el marcado de agua implementado. Según Siposova, el marcado de agua, que está destinado a ser imperceptible, introduce compromisos que afectan a la salida del modelo.
El marcado de agua de IA altera el comportamiento de los LLM en condiciones adversas — lupAI