Datalab lança omniextractbench para abordar viés e transparência nos benchmarks de extração de documentos
A Datalab introduziu o OmniExtractBench, um benchmark de código aberto projetado para melhorar a justiça e a transparência na extração de documentos estruturados. O benchmark avalia a precisão com que os sistemas podem preencher esquemas JSON a partir de PDFs, utilizando 620 documentos provenientes de quatro benchmarks existentes. Um avaliador determinístico classifica cada submissão e explica suas decisões, visando fornecer um quadro de avaliação padronizado em meio à proliferação de leaderboards específicos de fornecedores.
O OmniExtractBench utiliza o algoritmo de Hungária para alinhamento baseado no conteúdo, abordando os desafios apresentados por tabelas, onde desalinhamentos posicionais podem afetar drasticamente as pontuações. O benchmark também introduz uma camada de avaliação para refinar as métricas de precisão, distinguindo entre valores correspondentes, precisão e revocação. A Datalab relata que seu modo preciso alcançou 93,85% de precisão, seguido de perto por outros sistemas como Reducto deep_extract v2.
O benchmark está disponível via PyPI, com dados hospedados no Hugging Face e código disponível no GitHub. A Datalab enfatiza que campos vazios e marcadores não são considerados correspondências válidas, prevenindo a exploração através do preenchimento de esquemas. O lançamento, publicado em 27 de setembro de 2026, visa estabelecer um novo padrão para justiça e transparência nos benchmarks de extração de documentos.