[논문 리뷰] ColPali: Efficient Document Retrieval with Vision Language Models
ColPali는 문서 이미지에서 직접 텍스트 추출 없이 고품질의 맥락화된 임베딩을 생성하는 비전-언어 모델 기반 검색 시스템을 소개한다. 이 시스템은 시각적 특징과 후기 상호작용 매칭을 활용하여 기존의 텍스트 중심 검색 파이프라인보다 뛰어난 성능을 보이며, ViDoRe 벤치마크에서 최고 수준의 성능을 기록하고, 더 빠른 인덱싱과 저지연 검색을 구현한다.
Documents are visually rich structures that convey information through text, but also figures, page layouts, tables, or even fonts. Since modern retrieval systems mainly rely on the textual information they extract from document pages to index documents -often through lengthy and brittle processes-, they struggle to exploit key visual cues efficiently. This limits their capabilities in many practical document retrieval applications such as Retrieval Augmented Generation (RAG). To benchmark current systems on visually rich document retrieval, we introduce the Visual Document Retrieval Benchmark ViDoRe, composed of various page-level retrieval tasks spanning multiple domains, languages, and practical settings. The inherent complexity and performance shortcomings of modern systems motivate a new concept; doing document retrieval by directly embedding the images of the document pages. We release ColPali, a Vision Language Model trained to produce high-quality multi-vector embeddings from images of document pages. Combined with a late interaction matching mechanism, ColPali largely outperforms modern document retrieval pipelines while being drastically simpler, faster and end-to-end trainable. We release models, data, code and benchmarks under open licenses at https://hf.co/vidore.
연구 동기 및 목표
- 표현력이 풍부한 문서, 예를 들어 표, 그림, 레이아웃 등에서 시각적 특징을 충분히 활용하지 못하는 현재의 문서 검색 시스템의 한계를 해결하기 위해.
- OCR나 레이아웃 파싱 파이프라인에 의존하지 않고, 문서 이미지에서만 작동하는 검색 시스템을 개발하기 위해.
- 시각적 맥락을 통합하여 실세계 응용 분야(예: 검색 증강 생성(RAG))에서 검색 성능을 향상시키기 위해.
- 다양한 도메인, 다국어, 그리고 비주얼적으로 rich한 문서 검색 작업을 평가할 수 있는 종합적인 벤치마크인 ViDoRe를 구축하기 위해.
- 산업적 구현에 적합한 고처리량, 저지연, 엔드 투 엔드 학습이 가능한 문서 검색을 실현하기 위해.
제안 방법
- ColPali는 문서 페이지 이미지에서 직접 다중 벡터 임베딩을 생성하기 위해 비전-언어 모델(VLM)을 활용하며, OCR나 텍스트 추출이 필요하지 않다.
- 가장 관련성이 높은 이미지 패치에 주목하는 방식으로, 쿼리에서 문서로의 매칭 점수를 계산하는 후기 상호작용 메커니즘을 사용하여 높은 정확도를 저비용으로 달성한다.
- 문서 페이지에서 유도된 이미지-텍스트 쌍을 기반으로 대조 학습 목표를 사용해 모델을 피지컬러닝하여, 쿼리와 시각적 특징 간의 의미적 정렬을 최적화한다.
- 패치 기반 특징 추출 전략을 통해 각 문서 페이지를 여러 개의 시각적 토큰으로 나누어 세밀한 매칭과 관련 콘텐츠의 정밀한 국소화를 가능하게 한다.
- 학습 중에 저랭크 어댑터를 사용하여 계산 및 저장 비용을 줄여 대규모 문서 코퍼스에서의 효율적인 피지컬러닝을 가능하게 한다.
- 엔드 투 엔드 학습 및 추론을 지원하며, 다중 벡터 검색을 지원하는 벡터 데이터베이스와의 호환성도 확보한다.

실험 결과
연구 질문
- RQ1표, 그림, 레이아웃과 같은 시각적 요소의 이해가 필요한 문서 검색에서, 비전-언어 모델 기반 검색 시스템이 텍스트 중심 모델보다 뛰어난 성능을 낼 수 있는가?
- RQ2OCR 및 레이아웃 파싱 파이프라인을 생략하고 원시 이미지 특징을 사용할 경우, 문서 검색 성능은 어느 정도 향상될 수 있는가?
- RQ3다중 벡터 임베딩과 함께 후기 상호작용 메커니즘이 문서 검색의 정확도와 지연 시간에 어떤 영향을 미치는가?
- RQ4텍스트 추출에 의존하지 않고도 통합된 엔드 투 엔드 학습이 가능한 시스템이 다양한 도메인, 언어, 문서 유형에서 높은 성능을 달성할 수 있는가?
- RQ5실세계 산업 응용 분야(예: RAG 및 검색 엔진)에서 시각적 신호가 검색 성능에 어떤 영향을 미치는가?
주요 결과
- ColPali는 ViDoRe 벤치마크에서 최고 수준의 성능을 기록하며, 비주얼적으로 rich한 문서 검색 작업에서 기존의 텍스트 기반 검색 모델을 크게 앞서 간다.
- OCR 및 레이아웃 파싱을 생략함으로써 색인 시간을 줄여 전통적인 파이프라인 대비 더 빠른 코퍼스 인gest를 가능하게 한다.
- 효율적인 후기 상호작용 메커니즘 덕분에 쿼리 지연 시간이 낮아, 실시간 산업 응용에 적합하다.
- 다양한 도메인, 언어(영어 및 프랑스어 포함), 그리고 복잡한 시각적 구조를 가진 문서 유형에 걸쳐 뛰어난 일반화 성능을 보였다.
- ColPali 학습에는 약 40시간의 Mi250x AMD GPU 시간이 소요되었으며, 총 탄소 배출량은 약 15kg CO2 eq로, 낮은 환경 비용을 나타낸다.
- 오픈 라이선스 하에 ViDoRe 벤치마크와 ColPali 모델이 공개될 예정이며, 이는 비전 기반 문서 검색 분야의 향후 연구를 가속화할 것으로 기대된다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.