Skip to main content
QUICK REVIEW

[논문 리뷰] MarkupLM: Pre-training of Text and Markup Language for Visually-rich Document Understanding

Junlong Li, Yiheng Xu|arXiv (Cornell University)|2021. 10. 16.
Handwritten Text Recognition Techniques인용 수 10
한 줄 요약

이 논문은 동적 레이아웃을 가진 문서(예: HTML/XML)에서 시각적으로 rich한 문서 이해를 위해 트랜스포머 아키텍처와 XPath 임베딩을 사용하여 텍스트 및 마크업 언어 표현을 공동으로 학습하는 멀티모달 사전 훈련 프레임워크인 MarkupLM을 제안한다. 마스크된 마크업 언어 모델링, 노드 관계 예측, 제목-페이지 일치와 같은 새로운 사전 훈련 목표를 통해 WebSRC 및 SWDE 벤치마크에서 강력한 기준 모델을 능가한다.

ABSTRACT

Multimodal pre-training with text, layout, and image has made significant progress for Visually Rich Document Understanding (VRDU), especially the fixed-layout documents such as scanned document images. While, there are still a large number of digital documents where the layout information is not fixed and needs to be interactively and dynamically rendered for visualization, making existing layout-based pre-training approaches not easy to apply. In this paper, we propose MarkupLM for document understanding tasks with markup languages as the backbone, such as HTML/XML-based documents, where text and markup information is jointly pre-trained. Experiment results show that the pre-trained MarkupLM significantly outperforms the existing strong baseline models on several document understanding tasks. The pre-trained model and code will be publicly available at https://aka.ms/markuplm.

연구 동기 및 목표

  • 레이아웃이 동적으로 렲시되는 고정되지 않은 마크업 기반 문서(예: HTML/XML)에서 문서 표현 학습의 과제를 해결한다.
  • 기존의 2차원 레이아웃 또는 이미지 특징을 기반으로 하는 레이아웃 기반 사전 훈련 모델(LayoutLM 등)의 한계를 극복한다. 이러한 특징은 마크업 문서에서는 이용 가능하지 않다.
  • 텍스트, 마크업 구조(XPath를 통한), 순서 정보를 통합하여 문서 의미를 효과적으로 모델링할 수 있는 통합 사전 훈련 프레임워크를 개발한다.
  • 마크업 언어의 구조적 특성과 문서 내 의미적 관계에 특화된 새로운 자기지도 사전 훈련 목표를 설계한다.
  • 독해 및 데이터 추출과 같은 다운스트림 문서 이해 작업에서 MarkupLM의 유효성을 입증한다.

제안 방법

  • DOM 트리에서 각 토큰까지의 루트에서의 계층적 경로를 표현하기 위해 XPath 임베딩 레이어를 도입하여 LayoutLM에서 사용하는 2차원 레이아웃 임베딩을 대체한다.
  • 텍스트 임베딩, 1차원 위치 임베딩, 세그먼트 임베딩, XPath 임베딩을 결합한 다중 스트림 입력 임베딩 방식을 사용하여 문서 구조를 인코딩한다.
  • 세 가지 사전 훈련 목표를 제안한다: 마스크된 마크업 언어 모델링(MMLM)은 텍스트 및 마크업 토큰을 동시에 마스크하고 예측하도록 설계되며, 노드 관계 예측(NRP)은 DOM 트리 내 부모-자식 또는 형제 관계를 예측하고, 제목-페이지 일치(TPM)는 페이지 제목이 내용과 일치하는지 예측한다.
  • 표준 분류 또는 시퀀스 레이블링 헤드를 사용하여 다운스트림 작업에 대해 사전 훈련된 MarkupLM을 미세 조정한다.
  • BERT 또는 RoBERTa에서 초기화된 대규모 비라벨 웹페이지(예: 100만~2400만 페이지)를 활용하여 사전 훈련을 수행한다.
  • 다중 헤드 자기주의 및 피드포워드 네트워크를 사용하는 표준 트랜스포머 인코더를 입력 임베딩을 처리하는 데 사용한다.

실험 결과

연구 질문

  • RQ1동적으로 렌더링되는 문서(예: HTML/XML)에서 텍스트와 마크업 언어의 공동 사전 훈련이 문서 표현 학습에 기여하는가?
  • RQ2XPath 기반 임베딩이 2차원 레이아웃 임베딩에 비해 마크업 문서의 구조적 관계를 얼마나 효과적으로 포착하는가?
  • RQ3제안된 사전 훈련 목표인 MMLM, NRP, TPM이 문서 이해 작업의 다운스트림 성능에 얼마나 기여하는가?
  • RQ4대규모 비라벨 웹페이지에서 사전 훈련을 수행하면 독해 및 데이터 추출과 같은 다운스트림 작업에서 상당한 성능 향상이 이루어지는가?
  • RQ5MarkupLM는 다양한 문서 유형, 특히 기기 간 렌더링 방식이 다양할 수 있는 문서 유형으로도 일반화 가능한가?

주요 결과

  • WebSRC 데이터셋에서 MarkupLM은 강력한 기준 모델을 크게 능가하며, 모든 세 가지 사전 훈련 목표를 조합했을 때 정확도 일치(EM) 점수에서 5.3%p의 절대적 향상을 기록했다.
  • 제목-페이지 일치(TPM) 목표가 가장 큰 기여를 하였으며, 기준 모델 대비 EM 점수를 4.6%p 향상시켰고, 노드 관계 예측(NRP)은 EM 점수를 2.4%p 향상시켰다.
  • 더 강력한 초기화 모델(RoBERTa-base)을 사용할 경우 EM 점수에서 1.9%p 향상되었으며, 이는 초기화 품질의 중요성을 시사한다.
  • RoBERTa-base와 모든 세 가지 목표를 사용하여 2400만 개의 웹페이지에서 훈련한 경우가 가장 뛰어난 성능을 보였으며, WebSRC 개발 세트에서 EM 68.39%, F1 74.47%, POS 87.93%를 기록했다.
  • 제거 실험을 통해 세 가지 사전 훈련 목표 모두가 효과적이고 상호 보완적임을 확인하였으며, 조합 시 최고의 성능을 기록하였다.
  • 사전 훈련된 MarkupLM 모델 및 코드는 커뮤니티 사용 및 추가 연구를 위해 https://aka.ms/markuplm 에 공개되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.