[논문 리뷰] ERNIE-Layout: Layout Knowledge Enhanced Pre-training for Visually-rich Document Understanding
ERNIE-Layout는 읽기 순서 직렬화, 공간 인지적 분리된 자기주의, 그리고 새로운 사전 훈련 작업(읽기 순서 예측 및 대체 영역 예측)을 통합함으로써 레이아웃 지식을 강화한 사전 훈련 프레임워크를 제안한다. 이는 위치 인코딩을 넘어서 레이아웃을 제1의 모odal로 체계적으로 활용함으로써 키 정보 추출, 문서 질의 응답, 문서 분류 벤치마크에서 최고 성능을 달성한다.
Recent years have witnessed the rise and success of pre-training techniques in visually-rich document understanding. However, most existing methods lack the systematic mining and utilization of layout-centered knowledge, leading to sub-optimal performances. In this paper, we propose ERNIE-Layout, a novel document pre-training solution with layout knowledge enhancement in the whole workflow, to learn better representations that combine the features from text, layout, and image. Specifically, we first rearrange input sequences in the serialization stage, and then present a correlative pre-training task, reading order prediction, to learn the proper reading order of documents. To improve the layout awareness of the model, we integrate a spatial-aware disentangled attention into the multi-modal transformer and a replaced regions prediction task into the pre-training phase. Experimental results show that ERNIE-Layout achieves superior performance on various downstream tasks, setting new state-of-the-art on key information extraction, document image classification, and document question answering datasets. The code and models are publicly available at http://github.com/PaddlePaddle/PaddleNLP/tree/develop/model_zoo/ernie-layout.
연구 동기 및 목표
- 레이아웃 지식의 부적절한 활용으로 인한 시각적으로 rich한 문서 이해의 열악한 성능을 해결하기 위해.
- 문서 파싱 기반의 레이아웃 인지 직렬화로 래스터 스캔 순서를 대체함으로써 모델 일반화를 향상시키기 위해.
- 새로운 공간 인지적 분리된 주의 메커니즘을 통해 텍스트, 시각, 레이아웃 간의 다중 모odal 상호작용을 향상시키기 위해.
- 레이아웃 의미를 명시적으로 모델링하기 위해 읽기 순서 예측 및 대체 영역 예측과 같은 새로운 사전 훈련 작업을 도입하기 위해.
- 다양한 최종 문서 이해 작업 전반에서 최고 성능을 달성하기 위해.
제안 방법
- 표준 래스터 스캔 순서를 대체하기 위해 인간처럼 읽는 순서에 따라 입력 토큰을 직렬화하는 레이아웃 기반 문서 파서를 도입한다.
- 콘텐츠와 상대적 위치 표현을 분리하여 레이아웃 인지 주의 계산을 향상시키기 위해 공간 인지적 분리된 자기주의 메커니즘을 활용한다.
- 직렬화된 시퀀스에서 다음 토큰을 예측하는 읽기 순서 예측(Red) 작업을 제안하여 순차적이고 구조적인 문서 지식 학습을 장려한다.
- 텍스트, 레이아웃, 시각적 특징 간의 세밀한 다중 모달 정렬을 학습하기 위해 대체 영역 예측(RRP) 작업을 도입한다.
- 통합된 다중 모달 사전 훈련 목표 내에서 표준 마스킹 시각-언어 모델링 및 텍스트-이미지 정렬 작업을 결합한다.
- 레이아웃 임베딩과 위치 임베딩을 입력 특징으로 사용하며, 레이아웃 인지 주의가 더 풍부한 공간적 맥락 모델링을 가능하게 한다.
실험 결과
연구 질문
- RQ1래스터 스캔 순서를 레이아웃 인지 직렬화로 대체하면 최종 문서 이해 성능이 향상되는가?
- RQ2공간 인지적 분리된 주의를 통해 레이아웃을 제1의 모달로 통합하면 모델 성능이 향상되는가?
- RQ3읽기 순서 예측 및 대체 영역 예측과 같은 새로운 사전 훈련 작업이 레이아웃 인지 표현 학습에 얼마나 기여하는가?
- RQ4직렬화, 주의, 사전 훈련 작업 전반에 걸쳐 레이아웃 지식을 통합하면 다양한 문서 이해 작업에서 성능에 어떤 영향을 미치는가?
- RQ5레이아웃 강화 사전 훈련이 키 정보 추출, 문서 질의 응답, 문서 분류 벤치마크에서 최고 성능을 달성할 수 있는가?
주요 결과
- ERNIE-Layout은 FUNSD 데이터셋에서 F1 스코어 0.9171을 기록하며 이전 방법들을 능가하는 최고 성능을 달성한다.
- CORD 데이터셋에서 ERNIE-Layout은 F1 스코어 0.9678을 기록하여 복잡한 문서 레이아웃 전반에 걸친 강력한 일반화 능력을 보여준다.
- DocVQA에서 문서 질의 응답 작업을 수행한 결과, 앙상블 추론을 통해 랭킹에서 가장 높은 ANLS 스코어를 기록하며 이전 모델들을 크게 능가한다.
- RVL-CDIP 문서 이미지 분류 벤치마크에서 ERNIE-Layout은 새로운 최고 성능 정확도를 기록하며 강력한 매크로 수준의 문서 이해 능력을 보여준다.
- 절단 실험 결과, 읽기 순서 예측(Red)이 FUNSD에서 F1 스코어 1.3% 향상 기여를 하며, 공간 인지적 분리된 주의가 추가로 성능 향상을 이룬다.
- 문서 파서를 통한 레이아웃 인지 직렬화 사용은 분리된 주의 없이도 성능 향상을 이끌어내어 그 독립적인 효과를 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.