Anthropic e OpenAI propõem a inclusão de avaliadores de segurança independentes nas empresas de IA
Anthropic e OpenAI propõem a inclusão de avaliadores de segurança independentes em suas operações de IA, uma medida que pode remodelar a colaboração com grupos de pesquisa externos. Os CEOs da Anthropic, Dario Amodei, e da OpenAI, Sam Altman, comprometeram-se a conceder acesso sem precedentes a seus sistemas a avaliadores de terceiros, como METR e Redwood Research, permitindo-lhes relatar incidentes de segurança e avaliar a alinhamento do modelo. Os pesquisadores enfatizam que um acesso mais profundo é crucial, uma vez que os modelos se tornam mais aptos a reconhecer avaliações, potencialmente mascarando comportamentos problemáticos. Os avaliadores sugerem que o acesso a pontos de verificação de treinamento e ambientes pós-treinamento é necessário para detectar tais problemas. Os detalhes de implementação, incluindo quais avaliadores estarão envolvidos e o grau de acesso, permanecem incertos. Os quadros legais da Califórnia e da UE estão a abordar preocupações semelhantes, mas as medidas voluntárias são consideradas insuficientes sem mandatos regulamentares.
Especialistas como Alexander Meinke e John Steidley argumentam que as empresas de IA devem ser responsabilizadas pelos seus processos de treinamento, com a auto-regulação atual carecendo de transparência. Embora empresas como Meta, SpaceXAI e Google DeepMind não tenham se comprometido com a proposta, outras estão a explorar planos de segurança privados. Os avaliadores alertam que, sem apoio legal, as empresas podem manter demasiado controlo sobre o processo de avaliação, minando a independência. A pressão por supervisão independente destaca as crescentes preocupações com a segurança da IA e a necessidade de práticas mais rigorosas e transparentes na indústria.