Claude Opus 5 integra três novos benchmarks de avaliação
A Anthropic adicionou novos testes ao system card do modelo Claude Opus 5. Os benchmarks—Riemann-bench, Chartography e GDP.pdf—avaliam capacidades específicas do assistente de IA em domínios técnicos variados.
A integração desses novos critérios expande o marco de avaliação disponível para medir desempenho do modelo em múltiplos contextos de aplicação.