Novos Desenvolvimentos

Claude Opus 5 integra três novos benchmarks de avaliação

Anthropic + Claude Opus 5Fonte: Edwin Chen (X)24/07/2026, 19:17
A Anthropic adicionou novos testes ao system card do modelo Claude Opus 5. Os benchmarks—Riemann-bench, Chartography e GDP.pdf—avaliam capacidades específicas do assistente de IA em domínios técnicos variados. A integração desses novos critérios expande o marco de avaliação disponível para medir desempenho do modelo em múltiplos contextos de aplicação.
Claude Opus 5 integra três novos benchmarks de avaliação — lupAI