paper-with-me

홈 › Papers

Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy

2025-10-25 · Juyeon Kim, Geon Lee, Dongwon Choi, Taeuk Kim, Kijung Shin arxiv

Retrieval over visually rich documents is essential for tasks such as legal discovery, scientific search, and enterprise knowledge management. Existing approaches fall into two paradigms: single-vector retrieval, which is efficient but coarse, and multi-vector retrieval, which is accurate but computationally expensive. To address this trade-off, we propose HEAVEN, a plug-and-play two-stage hybrid-vector framework. In the first stage, HEAVEN efficiently retrieves candidate pages using a single-vector method over Visually-Summarized Pages (VS-Pages), which assemble representative visual layouts from multiple pages. In the second stage, it reranks candidates with a multi-vector method while filtering query tokens by linguistic importance to reduce redundant computations. To evaluate retrieval systems under realistic conditions, we also introduce ViMDoc, a benchmark for visually rich, multi-document, and long-document retrieval. Across four benchmarks, HEAVEN attains 99.87% of the Recall@1 performance of multi-vector models on average while reducing per-query computation by 99.82%, achieving efficiency and accuracy. Our code and datasets are available at: https://github.com/juyeonnn/HEAVEN

📄 PDF Abstract BibTeX arXiv:2510.22215

Code (0)

등록된 구현이 없습니다.

Similar Papers 제목 키워드 기반

A Multi-Granularity Retrieval Framework for Visually-Rich Documents

2025-05-01 · Mingjun Xu, Zehui Wang, Hengxing Cai, Renxin Zhong

Retrieval-augmented generation (RAG) systems have predominantly focused on text-based retrieval, limiting their effectiveness in handling visually-rich documents that encompass text, images, tables, and charts. To bridge…

Language ModelingLanguage ModellingRAGRetrieval+1

ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents

2025-02-25 · Qiuchen Wang, Ruixue Ding, Zehui Chen, Weiqi Wu 외

Understanding information from visually rich documents remains a significant challenge for traditional Retrieval-Augmented Generation (RAG) methods. Existing benchmarks predominantly focus on image-based question answeri…

Question AnsweringRAGRetrievalRetrieval-augmented Generation

VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents

2025-04-14 · CVPR 2025 1 · Ryota Tanaka, Taichi Iki, Taku Hasegawa, Kyosuke Nishida 외

We aim to develop a retrieval-augmented generation (RAG) framework that answers questions over a corpus of visually-rich documents presented in mixed modalities (e.g., charts, tables) and diverse formats (e.g., PDF, PPTX…

Question AnsweringRAGRetrievalRetrieval-augmented Generation+1

ColPali: Efficient Document Retrieval with Vision Language Models

2024-06-27 · Manuel Faysse, Hugues Sibille, Tony Wu, Bilel Omrani 외

Documents are visually rich structures that convey information through text, but also figures, page layouts, tables, or even fonts. Since modern retrieval systems mainly rely on the textual information they extract from …

document understandingRAGRetrievalRetrieval-augmented Generation+1

Finder: A Multimodal AI-Powered Search Framework for Pharmaceutical Data Retrieval

2026-01-06 · Suyash Mishra, Srikanth Patil, Satyanarayan Pati, Sagar Sahu 외 arxiv

AI is transforming pharmaceutical search, where traditional systems struggle with multimodal content and manual curation. Finder is a scalable AI-powered framework that unifies retrieval across text, images, audio, and v…