Seguridad y Ética

Un fallo fundamental hace imposible asegurar completamente los modelos de lenguaje

Fuente: MIT Technology Review - AI30/07/2026, 07:15
Investigadores presentaron este mes en la conferencia ICML, uno de los principales foros de inteligencia artificial, resultados que demuestran que existe un defecto estructural en los grandes modelos de lenguaje que los hace fundamentalmente imposibles de proteger completamente contra ataques. Este hallazgo tiene implicaciones graves considerando que la tecnología se despliega cada vez más en aplicaciones críticas que van desde sistemas militares y gubernamentales hasta sanidad y comercio electrónico. Los investigadores independientes Jasmine Cui y Charles Ye descubrieron cómo los LLM determinan la procedencia de las instrucciones que reciben y explotaron este mecanismo para hacer que modelos de última generación revelaran información que fueron específicamente entrenados para ocultar. Sus ataques lograron obtener instrucciones para sintetizar cocaína y sabotaje de sistemas de navegación de aeronaves. La técnica, que denominan "falsificación de cadena de pensamiento", funciona imitando los patrones de razonamiento interno que generan los modelos al procesar información, engañando al modelo para que crea que las instrucciones maliciosas provienen de sí mismo. Las prácticas de seguridad actuales se basan en pruebas de ataque (red-teaming), donde expertos humanos y sistemas basados en IA como GPT-Red de OpenAI buscan nuevas formas de comprometer los modelos para entrenarlos en su resistencia. Pero como explica Cui, este enfoque se reduce a enseñar a los modelos a evitar una lista finita de comportamientos prohibidos, una solución inherentemente incompleta. Cada intento de agregar restricciones puede ser eludido mediante nuevas formas creativas de expresión que los evaluadores no anticiparon. Detrás de este problema está el mecanismo mediante el cual los LLM rastrean el origen de las instrucciones usando etiquetas de rol: <user> para entrada del usuario, <system> para instrucciones base, <think> para razonamiento interno y <tool> para contenido externo. La investigación reveló algo sorprendente: los modelos no respetan realmente estas etiquetas. En su lugar, identifican el rol de un texto basándose en su estilo y patrones de palabras. Un atacante solo necesita escribir de manera convincente en un estilo particular para engañar al modelo, independientemente de qué etiquetas aparezcan en el prompt. Aunque el artículo del ICML demostró principalmente ataques contra modelos de OpenAI, Cui y Ye han replicado desde entonces vulnerabilidades similares en modelos de Anthropic, Alibaba y DeepSeek. El descubrimiento destaca una preocupación más profunda: la arquitectura fundamental de los LLM contiene un defecto que ninguna cantidad de entrenamiento puede resolver completamente. Charles Ye advirtió que las organizaciones que despliegan estos sistemas en infraestructuras críticas carecen de una comprensión adecuada de estos riesgos fundamentales, y los incentivos económicos para su explotación son enormes.
Un fallo fundamental hace imposible asegurar completamente los modelos de lenguaje — lupAI