[논문 리뷰] VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
VisRAG는 텍스트 파싱을 생략하고 문서 이미지를 직접 시각-언어 모델(VLM) 기반 검색기와 생성기의 입력으로 사용함으로써 시각 기반 검색 보강 생성 프레임워크를 제안한다. 전체 시각적 및 레이아웃 정보를 유지함으로써 VisRAG는 텍스트 기반 RAG보다 종합 성능이 25–39% 높으며, 특히 텍스트 파싱으로 인해 정보 손실이 발생하는 레이아웃 민감도가 높은 작업에서 뛰어난 성능을 발휘한다.
Retrieval-augmented generation (RAG) is an effective technique that enables large language models (LLMs) to utilize external knowledge sources for generation. However, current RAG systems are solely based on text, rendering it impossible to utilize vision information like layout and images that play crucial roles in real-world multi-modality documents. In this paper, we introduce VisRAG, which tackles this issue by establishing a vision-language model (VLM)-based RAG pipeline. In this pipeline, instead of first parsing the document to obtain text, the document is directly embedded using a VLM as an image and then retrieved to enhance the generation of a VLM. Compared to traditional text-based RAG, VisRAG maximizes the retention and utilization of the data information in the original documents, eliminating the information loss introduced during the parsing process. We collect both open-source and synthetic data to train the retriever in VisRAG and explore a variety of generation methods. Experiments demonstrate that VisRAG outperforms traditional RAG in both the retrieval and generation stages, achieving a 20--40% end-to-end performance gain over traditional text-based RAG pipeline. Further analysis reveals that VisRAG is efficient in utilizing training data and demonstrates strong generalization capability, positioning it as a promising solution for RAG on multi-modality documents. Our code and data are available at https://github.com/openbmb/visrag.
연구 동기 및 목표
- 다중 모달 문서에서 텍스트 기반 RAG의 한계를 해결하기 위해, 파싱 과정에서 정보 손실이 발생하고 레이아웃 신호가 忽略되는 문제를 해결한다.
- 시각-언어 모델(VLM)이 중간 텍스트 추출 없이 텍스트 기반 검색 및 생성 파이프라인을 직접 대체할 수 있는지 조사한다.
- 원본 문서 구조와 시각적 의미를 유지하는 순수 시각 기반 RAG 파이프라인을 개발한다.
- 실제 다중 모달 문서, 특히 복잡한 레이아웃과 그림이 포함된 문서에서 VLM 기반 검색 및 생성의 효과성을 평가한다.
- 다양한 문서 유형과 질의 시나리오에 걸쳐 접근법의 일반화 능력과 강건성을 입증한다.
제안 방법
- VisRAG는 시각 인코더 토큰의 가중 평균 풀링을 통해 직접 문서 이미지를 임bedding하는 VLM 기반 검색기(VisRAG-Ret)를 사용하며, OCR 및 텍스트 파싱을 생략한다.
- 검색기는 양방향 인코더 아키텍처를 활용하여 질의와 문서 이미지를 동일한 임베딩 공간으로 매핑함으로써 밀도 기반 검색을 수행한다.
- 생성에 대해서는 VisRAG-Gen이 검색된 문서 이미지를 기반으로 답변을 생성하며, 페이지 연결과 가중 선택을 통한 다중 이미지 지원을 통해 단일 이미지 입력 모델에도 대응한다.
- 프레임워크는 개방형 VQA 데이터셋과 웹 크롤링된 PDF에서 유도된 합성 질의-문서 쌍의 조합을 기반으로 훈련된다.
- 레이아웃과 시각적 맥락이 전반적으로 유지되어 공간적 관계와 문서 구조를 정확히 해석할 수 있다.
- 단일 이미지 및 다중 이미지 VLM을 모두 지원하며, 검색 및 생성 과정에서 시각적 정밀도를 유지하기 위한 적응형 처리를 구현한다.
실험 결과
연구 질문
- RQ1시각-언어 모델 기반 RAG 파이프라인이 다중 모달 문서 이해에서 기존 텍스트 기반 RAG를 능가할 수 있는가?
- RQ2텍스트 파싱 파이프라인과 비교해 시각적 레이아웃과 이미지 콘텐츠를 유지할 경우 검색 및 생성 정확도가 얼마나 향상되는가?
- RQ3글꼴이나 포맷 문제로 인해 텍스트 추출에 실패하는 레이아웃 민감도가 높은 질의에서 VisRAG는 어떻게 성능을 내는가?
- RQ4검색 과정에서 이미지를 직접 사용할 경우, 계단식 파싱 파이프라인에 비해 정보 손실이 줄어드는가?
- RQ5Infographics, 매뉴얼, 양식 등 다양한 문서 유형에서 VisRAG는 텍스트 콘텐츠에 거의 의존하지 않고 일반화가 가능한가?
주요 결과
- VisRAG는 다중 모달 문서 벤치마크에서 기존 텍스트 기반 RAG 파이프라인보다 종합 성능이 25–39% 향상된다.
- 레이아웃 민감도가 높은 작업, 예를 들어 특정 영역(예: 유럽 대비 영국)과 관련된 백분율을 식별하는 작업에서 VisRAG는 유럽에 대해 53%를 정확히 식별하지만, TextRAG는 파싱으로 인한 레이아웃 혼동으로 실패한다.
- 장식적인 폰트로 인해 대상 용어(예: 'Club Jetty')가 가림을 입은 문서에서도 VisRAG는 성공적으로 검색하지만, TextRAG는 추출에 실패하여 검색을 수행할 수 없다.
- VLM 기반 검색기는 동일한 조건에서 훈련된 최첨단 텍스트 및 시각 중심 검색기보다도 우수한 성능을 보인다.
- GPT-4o를 사용할 경우, 더 많은 검색 문서를 활용할수록 VisRAG의 성능 향상이 뚜렷해지며, 다중 문서 컨텍스트에서 강력한 확장성을 보여준다.
- VisRAG는 뛰어난 일반화 능력과 훈련 데이터의 효과적 활용을 보이며, 다양한 문서 레이아웃과 시각적 구조에 대해 강건함을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.