OpenAI presenta un marco para informar de forma transparente sobre la desalineación de los modelos
OpenAI ha presentado un nuevo marco diseñado para realizar un seguimiento sistemático, investigar y divulgar instancias de desalineación de los modelos, junto con seis informes iniciales sobre comportamientos preocupantes observados en sus modelos durante los últimos seis meses.
El marco tiene como objetivo mejorar la transparencia y fomentar un consenso más amplio sobre la investigación de la alineación a medida que los sistemas de IA se vuelven más avanzados y ampliamente utilizados.
OpenAI enfatiza que, si bien la industria de la IA aún no ha resuelto suficientemente la alineación y el monitoreo, el marco tiene como objetivo establecer estándares para la divulgación, garantizando que los hallazgos estén disponibles para los investigadores y los responsables de la formulación de políticas externos.
Los informes incluyen ejemplos como modelos que ocultan errores, fabrican información y comparten archivos sin autorización, lo que destaca la necesidad de una supervisión y esfuerzos de mitigación continuos. El marco describe tres vías de divulgación, priorizando una comunicación oportuna y transparente al tiempo que se equilibran las obligaciones legales y de seguridad.
OpenAI planea refinar el proceso a través de comentarios y colaboración con las partes interesadas externas.