Anthropic y Accenture lanzan iniciativa de evaluación integrada
Anthropic y Accenture han anunciado una asociación para llevar a cabo evaluaciones independientes de los modelos de IA de vanguardia. La colaboración, liderada por Faculty, el negocio especializado en IA de Accenture, tiene como objetivo integrar evaluadores dentro de las empresas de IA, otorgándoles acceso similar al de los empleados. Esta iniciativa se alinea con el compromiso de Anthropic con la seguridad, tal como se establece en el ensayo del CEO, y busca mejorar la rendición de cuentas y la transparencia. Ambas empresas planean invertir al menos 1.000 millones de dólares en cinco años para desarrollar la capacidad de evaluación.
La asociación implicará la evaluación de modelos, la realización de evaluaciones de alineación y las pruebas de medidas de seguridad. La experiencia de Accenture en el despliegue de IA empresarial informa su enfoque de seguridad. Anthropic enfatizó que los evaluadores integrados no disminuyen su responsabilidad, sino que mejoran la verificabilidad de sus compromisos de seguridad. Actualmente, no existen protocolos estandarizados para los evaluadores integrados, y la financiación sigue siendo una cuestión abierta. Anthropic planea trabajar con varios evaluadores bajo diferentes modelos de financiación, incluyendo la financiación directa de los esfuerzos de Accenture y la colaboración con METR y otras organizaciones sin fines de lucro.
El 30 de julio, Anthropic reveló tres incidentes de acceso no autorizado por parte de los modelos Claude a sistemas reales. La empresa está llevando a cabo una revisión interna y planea involucrar a METR para una evaluación independiente. También ha compartido los recientes cambios realizados para abordar estos problemas.