Jina AI lança jina-ocr-v1: analisador de documentos de alto desempenho para gpus de baixo custo
A Jina AI, uma divisão da Elastic, lançou o jina-ocr-v1, um analisador visual de documentos completo capaz de processar PDFs, digitalizações, tabelas, gráficos e faturas em Markdown limpo em uma única etapa. O modelo, com um total de 3,4 bilhões de parâmetros e 570 milhões de parâmetros de decodificação ativos por token, é otimizado para GPUs de baixo custo, como a NVIDIA L4. Ele apresenta decodificação especulativa e alcança pontuações de 91,14 em OmniDocBench v1.6 e 83,4 em olmOCR-Bench.
O modelo aprimora o DeepSeek-OCR, mantendo seus componentes de eficiência, e inclui uma cabeça FastMTP para geração de rascunhos. Ele processa até 1.156 tokens visuais por página e produz Markdown com tabelas HTML e fórmulas LaTeX. A Jina AI afirma que oferece o maior rendimento entre 14 sistemas, analisando 2,57 páginas por segundo em uma GPU A100 de 40 GB. O modelo está disponível para uso de pesquisa e não comercial sob uma licença CC BY-NC 4.0, com pesos abertos de aproximadamente 6,8 GB em BF16.
A Jina AI também fornece uma API hospedada e uma ferramenta de leitura para testes rápidos, juntamente com recursos para auto-hospedagem. O lançamento destaca melhorias no rendimento e velocidade, com um aumento de 1,95x em tokens por segundo em uma GPU L4. O desempenho do modelo é comparado com outros sistemas como PaddleOCR-VL-1.6 e HunyuanOCR-1.5, embora não seja o mais preciso.