OpenAI define princípios para avaliações de segurança de IA de terceiros
A OpenAI delineou prioridades e princípios-chave para avaliações de terceiros da segurança de IA, enfatizando a necessidade de independência, rigor científico e práticas de segurança robustas. A empresa visa apoiar avaliações independentes com acesso profundo a salvaguardas técnicas, dados confidenciais e processos de implantação interna. Essas avaliações visam avaliar se as alegações de segurança são comprovadas e se as salvaguardas funcionam de forma eficaz em condições realistas. A OpenAI destaca quatro áreas prioritárias, incluindo a avaliação independente de casos de segurança, salvaguardas críticas, avaliações de capacidade para riscos de preparação e investigações de incidentes de desalinhamento. A empresa enfatiza a importância de metodologias transparentes, acesso proporcional e independência de especialistas para garantir que as avaliações sejam rigorosas e seguras.
As diretrizes também abordam a necessidade de alegações e escopo claros e mutuamente acordados para as avaliações, garantindo que terceiros e laboratórios estejam alinhados sobre o que está sendo avaliado. A OpenAI enfatiza o papel de investigações independentes na identificação de lacunas nos métodos e salvaguardas de alinhamento, particularmente em casos de desalinhamento de modelos. A empresa enfatiza que essas avaliações devem informar os casos de segurança e contribuir para o desenvolvimento de padrões internacionais para práticas de segurança e segurança de IA.