Skip to main content
QUICK REVIEW

[논문 리뷰] DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding

Hao Feng, Qi Liu|arXiv (Cornell University)|2023. 11. 20.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

DocPedia는 DCT 계수를 사용하여 주파수 도메인에서 직접 고해상도 문서 이미지를 처리하는 혁신적인 대규모 다중모odal 모델을 제안한다. 이는 OCR 없이도 뛰어난 인식과 이해 능력을 가능하게 하며, 双단계 훈련 전략과 주파수 도메인 시각 인코딩을 활용해 DocVQA 및 TextVQA와 같은 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다. 특히 2,560×2,560 해상도에서 뛰어난 성능을 보인다.

ABSTRACT

This work presents DocPedia, a novel large multimodal model (LMM) for versatile OCR-free document understanding, capable of parsing images up to 2,560$ imes$2,560 resolution. Unlike existing work either struggle with high-resolution documents or give up the large language model thus vision or language ability constrained, our DocPedia directly processes visual input in the frequency domain rather than the pixel space. The unique characteristic enables DocPedia to capture a greater amount of visual and textual information using a limited number of visual tokens. To consistently enhance both perception and comprehension abilities of our model, we develop a dual-stage training strategy and enrich instructions/annotations of all training tasks covering multiple document types. Extensive quantitative and qualitative experiments conducted on various publicly available benchmarks confirm the mutual benefits of jointly learning perception and comprehension tasks. The results provide further evidence of the effectiveness and superior performance of our DocPedia over other methods.

연구 동기 및 목표

  • 기존의 OCR 없이 작동하는 문서 이해 모델이 시각적 해상도를 제한하거나 언어 처리를 위해 경량 디코더를 사용하는 데서 비롯하는 한계를 해결한다.
  • 문서 이해에서 고해상도 시각 인식과 강력한 언어 이해 능력 간의 상충 관계를 극복한다.
  • 세부적인 시각적 정보를 유지하면서도 대규모 언어 모델(LLM)을 활용해 추론 및 세계 지식 활용이 가능한 고해상도 문서에서의 효과적인 활용을 가능하게 한다.
  • 다양한 문서 이해 능력을 동시에 최적화하는 훈련 전략을 개발하여 유연한 문서 이해를 실현한다.
  • 다중모달 모델의 시각 인코더에 대한 픽셀 공간 입력의 대안으로 주파수 도메인 표현의 가능성을 탐색한다.

제안 방법

  • 문서 이미지를 JPEG DCT를 통해 처리하여 시각 인코더의 입력으로 사용할 주파수 도메인 계수를 추출함으로써, 중요한 시각적 및 텍스트 정보를 유지하면서도 토큰 수를 줄인다.
  • DCT 계수와 시각 인코더 간 격차를 메우기 위해 주파수 어댑터를 도입하여 주파수 도메인에서의 효과적인 특징 학습을 가능하게 한다.
  • 이중 단계 훈련 전략을 적용: 먼저 이미지-텍스트 쌍을 사용해 대조 학습으로 시각 인코더를 사전 훈련한 후, 인식(OCR, 캡션 생성)과 이해(VQA, 문서 이해) 작업을 동시에 토대로 미세 조정한다.
  • 대규모 언어 모델(LLM)을 사용해 주파수 도메인에서 유래한 시각 토큰과 지시어에서 유도된 토큰을 통합하여 응답을 생성함으로써 논리적 추론 및 세계 지식 활용이 가능하다.
  • 다양한 문서 유형(영수증, 학술 논문, 양식 등)에 걸쳐 풍부하게 애너테이션된 지시어와 데이터를 활용해 모델을 최적화한다.
  • 추론 중에 매우 고해상도 입력을 처리하기 위해 형태 적응형 자르기 전략을 적용하여 모델의 고해상도 처리 능력을 최대한 활용한다.

실험 결과

연구 질문

  • RQ1이미지의 주파수 도메인 표현이 고해상도 문서 이해에서 대규모 다중모달 모델의 효율성과 성능을 향상시킬 수 있는가?
  • RQ2인식 및 이해 작업을 동시에 사전 훈련하고 미세 조정하면 모델 능력이 상호 보완적으로 향상되는가?
  • RQ3픽셀 공간 기반 기준 모델 대비 주파수 도메인 입력 파이프라인은 비주얼 토큰 효율성과 해상도 확장성 측면에서 뛰어나게 작동하는가?
  • RQ4경량 디코더 대비 전체 LLM을 사용해 추론을 수행할 경우, 복잡한 문서 이해 작업에서 성능 향상 정도는 어느 정도인가?
  • RQ5매우 고해상도 또는 다중 페이지 문서에서 모델의 성능은 어떠한가? 이러한 상황에서의 한계는 무엇인가?

주요 결과

  • 1,920×1,920 해상도 입력에서 DocPedia는 DocVQA 벤치마크에서 53.35%의 VQA 점수를 기록하여 오직 이미지 기반 입력을 사용하는 기존 방법들을 능가한다.
  • 2,560×2,560 해상도에서 DocPedia는 복잡한 질의에 정확한 응답을 생성하며, 해상도가 낮을 때보다 성능 향상이著명하다.
  • 주파수 도메인 입력 전략 덕분에 동일한 해상도에서 픽셀 공간 입력 대비 비주얼 토큰 수를 1/4로 줄여도 높은 성능을 유지할 수 있다.
  • 절단 실험 결과, 사전 훈련이 필수적임을 입증함 — 이를 생략할 경우 성능 저하가 심각하게 발생하여 시각-LLM 특징 일치의 중요성을 강조한다.
  • 인식 및 이해 작업을 동시에 미세 조정할 경우, 별도로 훈련하는 것보다 더 우수한 성능을 기록함으로써, 동시에 학습이 상호 보완적 이점을 가짐을 확인한다.
  • 특히 고해상도에서 텍스트 위치 지정 및 추론 작업(예: 그림 1의 Q3)에서 뛰어난 성능을 보이며, 픽셀 기반 모델이 저해상도로 축소되면서 실패하는 상황에서도 유의미한 성능 유지를 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.