Anthropic e Accenture lançam iniciativa de avaliação integrada
Anthropic e Accenture anunciaram uma parceria para realizar avaliações independentes de modelos de IA de ponta. A colaboração, liderada pela Faculty, a divisão de IA especializada da Accenture, visa integrar avaliadores dentro de empresas de IA, concedendo-lhes acesso semelhante ao de funcionários. Esta iniciativa está alinhada com o compromisso da Anthropic com a segurança, conforme delineado no ensaio do seu CEO, e visa melhorar a responsabilização e a transparência. Ambas as empresas planeiam investir pelo menos 1 bilhão de dólares ao longo de cinco anos para construir capacidade de avaliação.
A parceria envolverá a avaliação de modelos, a realização de avaliações de alinhamento e o teste de salvaguardas. A experiência da Accenture no lançamento de IA empresarial informa a sua abordagem de segurança. A Anthropic enfatizou que os avaliadores integrados não reduzem a sua responsabilidade, mas sim melhoram a verificabilidade dos seus compromissos de segurança. Atualmente, não existem protocolos padronizados para avaliadores integrados, e o financiamento permanece uma questão em aberto. A Anthropic planeia trabalhar com vários avaliadores sob diferentes modelos de financiamento, incluindo o financiamento direto dos esforços da Accenture e a colaboração com a METR e outras organizações sem fins lucrativos.
Em 30 de julho, a Anthropic divulgou três incidentes de acesso não autorizado por modelos Claude a sistemas reais. A empresa está a realizar uma revisão interna e planeia envolver a METR para uma avaliação independente. Também partilhou as recentes alterações feitas para abordar estes problemas.