Skip to main content
QUICK REVIEW

[논문 리뷰] LAMPRET: Layout-Aware Multimodal PreTraining for Document Understanding

Te-Lin Wu, Cheng Li|arXiv (Cornell University)|2021. 04. 16.
Handwritten Text Recognition Techniques참고 문헌 32인용 수 7
한 줄 요약

LAMPRET는 두 개의 연결된 트랜스포머를 사용하여 공간적으로 순서가 지정된 콘텐츠 블록(텍스트, 이미지, 표 등)으로 문서를 모델링하는 계층적이고 레이아웃 인식 다중모달 사전학습 프레임워크이다. 마스크된 언어 모델링, 이미지-텍스트 매칭, 그리고 새로운 레이아웃 인식 목표(블록 순서 예측, 마스크된 블록 예측, 이미지 피팅)를 공동으로 사전학습함으로써 문서 완성 작업에서 최신 기준 성능을 달성한다. 이는 텍스트 블록 채우기 및 이미지 제안 작업에서 뛰어난 성능을 보여준다.

ABSTRACT

Document layout comprises both structural and visual (eg. font-sizes) information that is vital but often ignored by machine learning models. The few existing models which do use layout information only consider textual contents, and overlook the existence of contents in other modalities such as images. Additionally, spatial interactions of presented contents in a layout were never really fully exploited. To bridge this gap, we parse a document into content blocks (eg. text, table, image) and propose a novel layout-aware multimodal hierarchical framework, LAMPreT, to model the blocks and the whole document. Our LAMPreT encodes each block with a multimodal transformer in the lower-level and aggregates the block-level representations and connections utilizing a specifically designed transformer at the higher-level. We design hierarchical pretraining objectives where the lower-level model is trained similarly to multimodal grounding models, and the higher-level model is trained with our proposed novel layout-aware objectives. We evaluate the proposed model on two layout-aware tasks -- text block filling and image suggestion and show the effectiveness of our proposed hierarchical architecture as well as pretraining techniques.

연구 동기 및 목표

  • 기존 모델이 문서 표현 학습에서 레이아웃 구조와 다중모달 콘텐츠(예: 이미지)를 忽시하는 격차를 해결하기 위해.
  • 로컬 블록 수준의 상호작용과 글로벌 문서 수준의 레이아웃 구조를 모두 모델링하는 계층적 프레임워크를 개발하기 위해.
  • 공간적 순서, 블록 수준의 마스크, 이미지 피팅을 활용하여 레이아웃 인식을 향상시키는 새로운 사전학습 목표를 설계하기 위해.
  • 검색 기반 설정에서 실제 응용 작업—텍스트 블록 채우기 및 이미지 제안—에 프레임워크를 평가하기 위해.
  • 단일모달 또는 템플릿 기반 문서를 초월하여 다중모달, 레이아웃 인식 문서 표현 학습을 위한 새로운 벤치마크를 수립하기 위해.

제안 방법

  • HTML 형식의 문서를 공간적으로 순서가 지정된 콘텐츠 블록으로 파싱하며, 각 블록은 위치, 의미적 유형, 레이아웃 속성(예: 폰트 크기)으로 주석 처리된다.
  • 하나의 저수준 다중모달 트랜스포머를 사용하여 텍스트 및 시각적 특징을 모두 활용해 개별 블록을 인코딩하며, 마스크된 언어 모델링(MLM)과 이미지-텍스트 매칭(ITM)으로 훈련된다.
  • 고수준 트랜스포머를 활용해 블록 표현을 집계하고, 블록 순서 예측, 마스크된 블록 예측, 이미지 피팅 예측의 세 가지 새로운 목표를 통해 글로벌 레이아웃 구조를 모델링한다.
  • 표준 자연어 처리 목표(MLM, ITM)와 레이아웃 특화 목표를 조합하여 종합적으로 훈련함으로써 구조적 및 다중모달 인식 능력을 향상시킨다.
  • 대조 학습 목표를 사용하여 최종 모델을 검색 기반 응용 작업에 대해 미세조정한다.
  • 입력 시퀀스에 레이아웃 기하학을 유지하기 위해 블록의 2차원 위치 기반 순서화를 활용한다.

실험 결과

연구 질문

  • RQ1계층적 트랜스포머 프레임워크는 다중모달 문서에서 로컬 블록 수준과 글로벌 문서 수준의 레이아웃 구조를 효과적으로 모델링할 수 있는가?
  • RQ2레이아웃 인식 사전학습 목표—블록 순서 예측, 마스크된 블록 예측, 이미지 피팅—는 최종 문서 이해 작업에 어떤 기여를 하는가?
  • RQ3다중모달 콘텐츠(텍스트, 이미지, 표)를 통합함으로써 단일모달 또는 텍스트 전용 모델 대비 문서 표현 성능이 얼마나 향상되는가?
  • RQ4레이아웃 속성(예: 폰트 크기, 공간적 위치)의 포함 여부가 레이아웃 민감 작업에서 모델 성능에 어떤 영향을 미치는가?
  • RQ5제안된 프레임워크는 수표와 같은 템플릿 기반 문서를 초월하여 위키백과 페이지와 같은 rich하고 콘텐츠가 자유로운 문서에도 일반화될 수 있는가?

주요 결과

  • 이미지 제안 작업에서 LAMPRET는 99.98%의 MRR과 Recall@5 98.55%를 기록하여 후보 집합에서 정확한 이미지를 선택하는 데 거의 완벽한 성능을 보였다.
  • 텍스트 블록 채우기 작업에서 LAMPRET는 F1 점수 52.09를 기록하며, 단일 수준의 LayoutLM 및 CNN-Grid 모델을 포함한 모든 베이스라인을 능가했다.
  • 제거 실험 결과, 블록 순서 예측 목표를 생략할 경우 성능 저하가 가장 심했으며(F1: 50.19), 이는 레이아웃 구조 학습에 있어 이 목표의 핵심적 역할을 확인시켰다.
  • 레이아웃 속성(예: 폰트 크기, 위치)을 제거해도 성능 저하가 미미하여, 계층적 트랜스포머를 통한 구조 모델링이 속성 특징 자체보다 더 큰 영향을 미친다는 것을 시사한다.
  • 다중모달 버전의 LAMPRET는 이미지 제안 작업에서 99.98% MRR을 기록하며 단일모달 대비 뛰어난 성능을 보였지만, 텍스트 블록 채우기 작업에선 약간의 성능 저하를 보였으며, 이는 다중모달 융합의 향상 여지가 있음을 시사한다.
  • 이미지 제안 작업에서 사전학습 시 이미지 피팅 목표가 포함되지 않으면 모델 수렴이 이루어지지 않아, 효과적인 다중모달 정렬을 위해 이 목표의 필수성은 명확히 드러났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.