Perplexity revela novo modelo de incorporação contextual para recuperação aprimorada em sistemas rag
A Perplexity e turbopuffer introduziram o pplx-embed-v2-context-9b-preview, um modelo de incorporação contextual projetado para melhorar a recuperação em sistemas de Geração Aumentada por Recuperação (RAG). O modelo incorpora documentos inteiros e aprende a recuperar respostas juntamente com evidências de suporte, em vez de depender de um único 'párgrafo de referência'. Está disponível como uma prévia auto-hospedada, com pesos no Hugging Face sob a licença MIT, embora ainda não esteja acessível através da API da Perplexity. O treinamento envolve um modelo professor que avalia tokens com base em consultas e documentos, permitindo limites de fragmentação flexíveis sem reanotação. O modelo, derivado de um modelo de recuperação ColBERT de 9B, suporta dimensões de 1024 e 2048, com treinamento consciente de quantização para incorporações int8. A Perplexity relata que supera o Voyage-context-4 em tarefas de recuperação de fragmentos, com sensibilidade medida pelo nDCG@10 médio em 74 tarefas MTEB.
A modelo aborda desafios em sistemas RAG tradicionais, onde fragmentos frequentemente dependem de entidades ou definições externas. Ao usar a fragmentação tardia e a agregação média, reduz a dependência de estratégias de fragmentação fixas. A Perplexity destaca problemas com rótulos binários e custos lineares de anotação, propondo uma abordagem de alvo suave usando pontuações de tokens. O lançamento inclui um tutorial interativo explicando como a destilação do professor substitui a rotulagem de um único 'párgrafo de referência', com resultados do context-bench mostrando melhorias nas métricas de desempenho.