Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Layout-aware IE for Visually Rich Documents with Pre-trained Language Models

Mengxi Wei, Yifan He|arXiv (Cornell University)|2020. 05. 22.
Multimodal Machine Learning Applications참고 문헌 36인용 수 4
한 줄 요약

이 논문은 시각적으로 rich한 문서(VRDs)에서 텍스트, 레이아웃, 폰트, 구조적 특징을 통합하여 강건하고 레이아웃 인식 정보 추출을 위한 그래프 신경망 강화 RoBERTa 모델을 제안한다. 인voice 및 레sume 데이터셋에서 각각 6.3% 및 4.7%의 절대 F1 향상을 달성하였으며, 도메인 내 미세조정 목적함수를 도입하여 소수의 샘플 설정에서 레이블링 필요성을 최대 30배까지 감소시켰다.

ABSTRACT

Many business documents processed in modern NLP and IR pipelines are visually rich: in addition to text, their semantics can also be captured by visual traits such as layout, format, and fonts. We study the problem of information extraction from visually rich documents (VRDs) and present a model that combines the power of large pre-trained language models and graph neural networks to efficiently encode both textual and visual information in business documents. We further introduce new fine-tuning objectives to improve in-domain unsupervised fine-tuning to better utilize large amount of unlabeled in-domain data. We experiment on real world invoice and resume data sets and show that the proposed method outperforms strong text-based RoBERTa baselines by 6.3% absolute F1 on invoices and 4.7% absolute F1 on resumes. When evaluated in a few-shot setting, our method requires up to 30x less annotation data than the baseline to achieve the same level of performance at ~90% F1.

연구 동기 및 목표

  • 순수 텍스트 외에 레이아웃, 폰트, 구조적 신호를 활용하여 시각적으로 rich한 문서(VRDs)인 청구서 및 이력서와 같은 도메인에서 정보 추출(IE)을 향상시키기 위해.
  • 레이아웃 의미를 忽시하는 텍스트 중심 모델의 한계를 해결하여, 도메인 특화된 시각적으로 복잡한 문서에서의 성능 향상을 도모하기 위해.
  • 레이아웃 인식 도메인 내 미세조정 목적함수를 도입하여, 레이블이 없는 도메인 내 데이터를 활용함으로써 대규모 레이블링 데이터에 대한 의존도를 줄이기 위해.
  • 더 나은 레이아웃 인코딩과 비지도 사전학습을 통해 일반화 능력을 향상시켜 강건한 소수의 샘플 학습을 가능하게 하기 위해.
  • 다양한 레이아웃 의미—예: 섹션 제목, 근접성, 폰트 변화—를 다중관계 그래프 신경망을 사용하여 모델링하기 위해.

제안 방법

  • 문서 텍스트로부터 깊은 문맥 표현을 캡처하기 위해 텍스트 인코더로 RoBERTa를 사용한다.
  • 노드가 텍스트 박스를 나타내고, 인접성 및 섹션 제목 연결과 같은 다중 레이아웃 관계를 엣지로 표현하는 이질적 그래프를 구축한다.
  • 노드 임bedding에 경계 상자 좌표, 폰트 크기, 폰트 유형 등의 시각적 특징을 통합하여 레이아웃 의미를 풍부하게 한다.
  • 다중 엣지 유형을 지원하는 GCN 기반 메시지 전달 메커니즘을 적용하여, 다양한 레이아웃 패턴에서 학습할 수 있도록 한다.
  • 두 가지 도메인 내 미세조정 목적함수를 도입: 레이아웃 관계를 학습하기 위한 순서 기반 관계 분류(SPRC)와 의미 이해를 유지하기 위한 마스킹 언어 모델링(MLM).
  • 레sume에서 관측되는 비대칭적인 레이아웃 관계 분포를 다루기 위해 SPRC에 클래스 균형 샘플링을 적용하여 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1경계 상자 외의 rich한 레이아웃 의미를 통합하면, 시각적으로 rich한 문서에서 정보 추출 성능 향상에 기여하는가?
  • RQ2그래프 신경망은 문서 내 복잡한 레이아웃 관계—예: 섹션 제목 및 폰트 기반 포맷팅—을 모델링하는 데 얼마나 효과적인가?
  • RQ3레이아웃 인식 도메인 내 미세조정가 레이블링 데이터 필요성을 소수의 샘플 IE 설정에서 얼마나 줄일 수 있는가?
  • RQ4사전학습된 언어 모델과 레이아웃 인식 그래프 인코더를 조합하면, 실제 비즈니스 문서에서 텍스트 중심 기준 모델보다 성능이 향상되는가?
  • RQ5위치, 폰트, 섹션 구조 중 어떤 레이아웃 특징이 엔티티 추출 정확도 향상에 가장 기여하는가?

주요 결과

  • 제안된 모델은 인voice 데이터셋에서 RoBERTa 기준 모델 대비 6.3% 절대 F1 향상을 달성하였으며, 레sume 데이터셋에선 4.7% 향상되었다.
  • 레sume 데이터셋에서 MLM 및 SPRC 목적함수를 함께 미세조정한 결과, F1은 72.13에 도달하여 단일 목적함수 또는 기준 방법보다 뛰어난 성능을 보였다.
  • 제거 실험 결과, 섹션 제목 엣지를 제거하면 F1이 0.8 포인트 감소하여 문서 구조 모델링에서의 중요성을 입증했다.
  • 노드 임베딩에 폰트 특징을 통합하면 F1이 0.5 포인트 향상되어 콘텐츠 유형을 구분하는 데 유의미한 기여를 한다는 것을 보여주었다.
  • GCN 레이어 간 스킵 연결을 제거하면 F1이 0.4 포인트 감소하여 깊은 그래프 학습에서 잔차 연결의 이점이 있음을 시사했다.
  • 소수의 샘플 설정에서 모델은 RoBERTa 기준 모델 대비 최대 30배 적은 레이블 데이터로 약 90% F1을 달성하여 높은 데이터 효율성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.