Pesquisa & Papers

Novo benchmark de inteligência financeira avalia desempenho de modelos de IA

Anthropic + OpenAI + SamayaFonte: Maithra Raghu (X)14/07/2026, 13:03
A OpenAI viu seu modelo GPT 5.6 Sol testado no FrontierFinance, um benchmark lançado simultaneamente com o modelo para avaliar inteligência financeira. O GPT 5.6 Sol atingiu 46,8% de precisão, ficando atrás do Fable 5 (49,2%) e acima do Opus 4.8 (45%). Apesar de não liderar em qualidade, o GPT 5.6 Sol apresenta vantagens em custo por consulta. O sistema Samaya Light mantém-se na fronteira Pareto com a melhor qualidade (50,8%) ao custo mais baixo, sendo aproximadamente 4 vezes mais económico. A análise comparativa identificou diferenças qualitativas entre os modelos em capacidades analíticas versus extração de dados financeiros. O FrontierFinance é descrito como o benchmark público mais amplo e rigoroso para testes de inteligência financeira.
Novo benchmark de inteligência financeira avalia desempenho de modelos de IA — lupAI