OpenAI detiene un intento coordinado de robar la lógica de los modelos
OpenAI reveló que había interrumpido una campaña coordinada destinada a extraer la lógica protegida de sus modelos, con actividad rastreada hasta el 1 de julio de 2026. La campaña, consistente con la destilación adversarial, implicaba manipular las interacciones del modelo para reproducir la lógica interna, lo que violaba los términos de servicio. Los operadores explotaban las interacciones del modelo en lugar de violar la encriptación o acceder a los datos de los usuarios. Se produjo un aumento en las solicitudes el 24 y 25 de julio, con más de 16.000 solicitudes de más de 4.000 usuarios. OpenAI atribuyó la actividad a individuos vinculados a Moonshot AI, el desarrollador de Kimi. La empresa enfatizó que la destilación adversarial plantea riesgos para la seguridad y la seguridad nacional, permitiendo la transferencia de capacidades avanzadas sin las mismas medidas de seguridad. OpenAI ha implementado controles técnicos, ha prohibido cuentas fraudulentas y ha compartido los hallazgos a través del Frontier Model Forum para fortalecer las defensas de la industria.
La empresa destacó nuevos métodos de ataque, incluida la intención de copiar la lógica encriptada de una conversación y que otro modelo la descifre. Investigadores de seguridad independientes habían identificado previamente vulnerabilidades entre modelos, que OpenAI confirmó que eran reales. OpenAI está reforzando las protecciones contra tales ataques, centrándose en salvaguardas técnicas, mecanismos de detección y el intercambio de información sobre amenazas entre la industria y el gobierno. La empresa enfatizó que la destilación adversarial es una amenaza en evolución que requiere defensas en capas y adaptación continua.