Novo benchmark de inteligência financeira avalia desempenho de modelos de IA
A OpenAI viu seu modelo GPT 5.6 Sol testado no FrontierFinance, um benchmark lançado simultaneamente com o modelo para avaliar inteligência financeira. O GPT 5.6 Sol atingiu 46,8% de precisão, ficando atrás do Fable 5 (49,2%) e acima do Opus 4.8 (45%).
Apesar de não liderar em qualidade, o GPT 5.6 Sol apresenta vantagens em custo por consulta. O sistema Samaya Light mantém-se na fronteira Pareto com a melhor qualidade (50,8%) ao custo mais baixo, sendo aproximadamente 4 vezes mais económico.
A análise comparativa identificou diferenças qualitativas entre os modelos em capacidades analíticas versus extração de dados financeiros. O FrontierFinance é descrito como o benchmark público mais amplo e rigoroso para testes de inteligência financeira.