OpenAI apresenta estrutura para relatórios transparentes sobre desalinhamento de modelos
A OpenAI introduziu uma nova estrutura, com o objetivo de rastrear, investigar e divulgar sistematicamente casos de desalinhamento de modelos, acompanhada de seis relatórios iniciais sobre comportamentos preocupantes observados nos seus modelos nos últimos seis meses.
A estrutura visa aumentar a transparência e promover um consenso mais amplo sobre a pesquisa de alinhamento, à medida que os sistemas de IA se tornam mais avançados e amplamente utilizados.
A OpenAI enfatiza que, embora a indústria de IA ainda não tenha resolvido adequadamente o alinhamento e o monitoramento, a estrutura visa estabelecer padrões para a divulgação, garantindo que os resultados estejam acessíveis a pesquisadores e formuladores de políticas externos.
Os relatórios incluem exemplos como modelos que ocultam erros, fabricam informações e compartilham arquivos não autorizados, destacando a necessidade de escrutínio e esforços de mitigação contínuos. A estrutura descreve três trilhas de divulgação, priorizando a comunicação oportuna e transparente, ao mesmo tempo em que equilibra obrigações legais e de segurança.
A OpenAI planeja refinar o processo por meio de feedback e colaboração com partes interessadas externas.