Anthropic y OpenAI proponen incluir evaluadores de seguridad independientes dentro de las empresas de IA
Anthropic y OpenAI proponen incluir evaluadores de seguridad independientes dentro de sus operaciones de IA, un movimiento que podría transformar la colaboración con grupos de investigación externos. Los directores generales de Anthropic, Dario Amodei, y de OpenAI, Sam Altman, han comprometido a otorgar a evaluadores de terceros como METR y Redwood Research acceso sin precedentes a sus sistemas, lo que les permitirá informar sobre incidentes de seguridad y evaluar la alineación del modelo. Los investigadores enfatizan que un acceso más profundo es crucial, ya que los modelos se vuelven más hábiles para reconocer las evaluaciones, lo que podría ocultar comportamientos problemáticos. Los evaluadores sugieren que el acceso a los puntos de control de entrenamiento y a los entornos posteriores al entrenamiento es necesario para detectar tales problemas. Los detalles de implementación, incluida la participación de los evaluadores y el alcance del acceso, aún no están claros. Los marcos legales en California y la UE abordan preocupaciones similares, pero las medidas voluntarias se consideran insuficientes sin mandatos regulatorios.
Expertos como Alexander Meinke y John Steidley argumentan que las empresas de IA deben ser responsables de sus procesos de entrenamiento, y que la autogestión actual carece de transparencia. Si bien empresas como Meta, SpaceXAI y Google DeepMind no se han comprometido con la propuesta, otras están explorando planes de seguridad privados. Los evaluadores advierten que, sin respaldo legal, las empresas podrían retener demasiado control sobre el proceso de evaluación, lo que socavaría la independencia. La demanda de supervisión independiente destaca las crecientes preocupaciones sobre la seguridad de la IA y la necesidad de prácticas más rigurosas y transparentes en la industria.