Skip to main content
QUICK REVIEW

[논문 리뷰] LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding

Yiheng Xu, Tengchao Lv|arXiv (Cornell University)|2021. 04. 18.
Natural Language Processing Techniques참고 문헌 21인용 수 48
한 줄 요약

LayoutXLM은 다중모달 사전학습 모델로서 다국어 시각적으로 풍부한 문서 이해(VrDU)를 다루며, form 이해를 위한 XFUND를 도입하고 다국어 벤치마크에서 최상의 성능을 달성합니다.

ABSTRACT

Multimodal pre-training with text, layout, and image has achieved SOTA performance for visually-rich document understanding tasks recently, which demonstrates the great potential for joint learning across different modalities. In this paper, we present LayoutXLM, a multimodal pre-trained model for multilingual document understanding, which aims to bridge the language barriers for visually-rich document understanding. To accurately evaluate LayoutXLM, we also introduce a multilingual form understanding benchmark dataset named XFUND, which includes form understanding samples in 7 languages (Chinese, Japanese, Spanish, French, Italian, German, Portuguese), and key-value pairs are manually labeled for each language. Experiment results show that the LayoutXLM model has significantly outperformed the existing SOTA cross-lingual pre-trained models on the XFUND dataset. The pre-trained LayoutXLM model and the XFUND dataset are publicly available at https://aka.ms/layoutxlm.

연구 동기 및 목표

  • Visually-rich Document Understanding(VrDU)에서 텍스트, 레이아웃, 이미지 모달리티를 활용하여 언어 장벽을 극복한다.
  • 대규모 실제 문서에서 다국어 모델을 사전학습하여 크로스링구얼 및 크로스모달 신호를 포착한다.
  • 7개 언어로 주요-값 주석이 있는 다국어 form 이해 데이터셋 XFUND를 생성하고 공개한다.
  • 다중모달 사전학습이 크로스링구얼 전이 및 form 이해 작업의 멀티태스크 성능을 개선함을 시연한다.

제안 방법

  • 텍스트, 레이아웃, 이미지 특징을 텍스트 임베딩, 레이아웃 임베딩, 시각 임베딩으로 인코드하는 다중모달 Transformer 아키텍처를 채택한다.
  • LayoutLMv2를 확장하여 InfoXLM에서 초기화된 다국어 사전학습과 시각 백본(ResNeXt101-FPN)을 도입한다.
  • 다음의 세 가지 사전학습 목표를 사용한다: Multilingual Masked Visual-Language Modeling (MMVLM), Text-Image Alignment (TIA), 그리고 Text-Image Matching (TIM).
  • MMVLM의 경우 토큰 경계는 SentencePiece로 문자 단위에서 정의되며 경계 상자 집계로 다국어 입력을 통일한다.
  • 훈련 데이터는 30 million documents로 구성되며(30M total: 22M multilingual digital-born PDFs and 8M scanned English IIT-CDIP documents).

실험 결과

연구 질문

  • RQ1다중모달 다국어 모델이 시각적으로 풍부한 문서에서 크로스링구얼 및 크로스도메인 표현을 효과적으로 학습할 수 있는가?
  • RQ2레이아웃과 이미지 정보를 도입하면 텍스트 기반 모델을 넘어 다양한 언어의 form 이해가 향상되는가?
  • RQ3제로샷 및 멀티태스크 설정에서 다국어 form 이해에 대한 크로스링구얼 전이가 얼마나 잘 작동하는가?

주요 결과

  • LayoutXLM LARGE은 XFUND에서 XLM-RoBERTa 및 InfoXLM-baselines 대비 SER 및 RE에서 가장 높은 F1 점수를 달성했다.
  • 언어별 미세조정에서 LayoutXLM LARGE은 8개 언어 설정 모두에서 SER 및 RE에 대해 베이스라인을 능가했다.
  • 영어 FUNSD에서 다른 언어로의 제로샷 전이의 경우 LayoutXLM은 레이아웃 불변성을 활용하여 텍스트 기반 모델보다 현저히 우수했다.
  • 8개 언어에 걸친 멀티태스크 미세조정은 언어별 미세조정보다 성능을 향상시키며 다국어 학습의 이점을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.