Linkup revela SPARSEUP: um modelo de embedding esparso de 149 milhões de parâmetros para uso de código aberto
A Linkup Research apresentou SPARSEUP, um modelo de embedding esparso de código aberto com 149 milhões de parâmetros, projetado para tarefas de recuperação eficientes. O modelo é construído sobre uma estrutura ModernBERT e lançado sob a licença Apache 2.0, com pesos disponíveis no Hugging Face. O SPARSEUP alcança uma pontuação média de nDCG@10 de 56,4 no benchmark BEIR-13, posicionando-o como o codificador esparso público mais forte com menos de 150 milhões de parâmetros.
Ao contrário dos modelos densos, o SPARSEUP gera vetores sobre um vocabulário, mapeando cada dimensão para um token real, o que se alinha com índices invertidos e melhora a legibilidade. O modelo foi desenvolvido em resposta às versões DenseOn e LateOn da LightOn, preenchendo a lacuna nos métodos de recuperação esparsos. O treinamento envolveu checkpoints não supervisionados do LateOn, com ajuste fino usando o aprendizado misto e contrastivo da LightOn, resultando em uma configuração de treinamento de uma única GPU H100.
No BEIR-13, o SPARSEUP supera o DenseOn em certas tarefas como ArguAna e Touché, mas fica atrás em conjuntos semânticos como FiQA. No BEIR descontaminado, a diferença em relação ao DenseOn é reduzida para 0,17 pontos, embora os resultados em NQ e MS MARCO sejam considerados ruidosos devido ao número limitado de consultas. O SPARSEUP também alcança alta precisão com a busca Seismic, atingindo mais de 97% em 380 microssegundos por consulta.