Samaya presenta FrontierFinance, benchmark para evaluar agentes de IA en flujos de inversión
Samaya presentó FrontierFinance, un benchmark con 220 casos de prueba y 11.543 rúbricas de evaluación diseñado para evaluar agentes de IA en todas las etapas del proceso de inversión: búsqueda de empresas, investigación, análisis sectorial y monitoreo de eventos.
A diferencia de benchmarks financieros existentes centrados en extracción de datos, FrontierFinance aborda escenarios complejos con decisiones de largo plazo. El sistema de IA de Samaya logró 50,8% de precisión con costos computacionales 4 veces menores que Claude Fable 5 (49,2%). Claude Opus 4.8 alcanzó 45% y GPT 5.5 43,5%.
El benchmark, metodología y resultados están disponibles públicamente. Samaya planea lanzar versiones más desafiantes basadas en su conjunto interno de aproximadamente 5.000 ejemplos.