[논문 리뷰] StructuralLM: Structural Pre-training for Form Understanding
StructuralLM는 셀을 의미 단위로 모델링하고 셀 수준의 2D 위치 임베딩 및 새로운 셀 위치 분류 사전 훈련 목표를 통해 양식 및 문서 이해를 위한 혁신적인 사전 훈련 접근법을 제안한다. 이미지 특징에 의존하지 않고 셀과 레이아웃 표현을 통합적으로 활용함으로써, 형식 이해(85.14 F1), 문서 VQA(83.94 F1), 문서 이미지 분류(96.08 정확도)에서 레이아웃LM 및 기타 기준 모델을 능가하는 최신 기술 성능을 달성한다.
Large pre-trained language models achieve state-of-the-art results when fine-tuned on downstream NLP tasks. However, they almost exclusively focus on text-only representation, while neglecting cell-level layout information that is important for form image understanding. In this paper, we propose a new pre-training approach, StructuralLM, to jointly leverage cell and layout information from scanned documents. Specifically, we pre-train StructuralLM with two new designs to make the most of the interactions of cell and layout information: 1) each cell as a semantic unit; 2) classification of cell positions. The pre-trained StructuralLM achieves new state-of-the-art results in different types of downstream tasks, including form understanding (from 78.95 to 85.14), document visual question answering (from 72.59 to 83.94) and document image classification (from 94.43 to 96.08).
연구 동기 및 목표
- 스캔된 문서에서 텍스트만 다루고 셀 수준의 레이아웃 구조를 忽시하는 기존 사전 훈련 모델의 한계를 해결하기 위해.
- 단일 토큰으로 분리된 것이 아니라, 동일한 셀 내의 단어들을 의미 단위로 모델링함으로써 형식 이해를 향상시키기 위해.
- 셀 수준의 2D 위치 임베딩과 새로운 셀 위치 분류 사전 훈련 목표를 도입하여 셀과 레이아웃 간의 상호작용을 향상시키기 위해.
- 이미지 특징에 의존하지 않고도 다운스트림 문서 이해 작업에서 최신 기술 성능을 달성하기 위해.
제안 방법
- StructuralLM는 셀 수준의 2D 위치 임베딩을 사용하는 BERT 기반 트랜스포머 인코더를 활용하며, 동일한 셀에 속한 모든 토큰이 동일한 2D 위치 임베딩을 공유한다.
- 셀 내부의 토큰 순서를 유지하기 위해 각 셀 내부에서 1D 위치 임베딩을 유지한다.
- 새로운 사전 훈련 목표인 셀 위치 분류를 도입: 일부 셀의 2D 위치를 마스킹하고, 마스킹된 셀이 N개의 동일한 크기의 영역 중 어느 곳에 속해 있는지 예측하도록 모델을 훈련시킨다.
- 마스크된 시각-언어 모델링 목표와 셀 위치 분류 목표를 사용하여 대규모의 레이블이 없는 문서 이미지에서 모델을 사전 훈련한다.
- LayoutLM와 달리 StructuralLM는 인코더에서 이미지 임베딩을 생략하여 더 효율적이며 실세계 문서 작업에 직접 적용 가능하다.
- 형식 이해, 문서 VQA, 문서 이미지 분류와 같은 다운스트림 작업에서 모델을 미세 조정한다.
실험 결과
연구 질문
- RQ1단어 수준의 모델링과 비교해 셀을 의미 단위로 모델링하는 것이 형식 및 문서 이해 작업 성능 향상에 기여하는가?
- RQ2셀 위치 분류 목표가 셀과 레이아웃 구조 간의 공간 관계를 포괄적으로 포착하는 데 얼마나 효과적인가?
- RQ3셀 수준의 의미와 2D 레이아웃 정보를 동시에 모델링하면, 양식과 표와 같은 다양한 문서 유형에 대한 일반화 능력 향상에 기여하는가?
- RQ4이미지 특징이 없는 사전 훈련 모델이 여전히 문서 이해에서 최신 기술 성능을 달성할 수 있는가?
주요 결과
- StructuralLM는 형식 이해 작업에서 85.14 F1이라는 새로운 최신 기술 성능을 기록하며 LayoutLM의 78.95에서 향상되었다.
- 문서 시각적 질의 응답 성능은 83.94 F1로 향상되었으며, LayoutLM의 72.59에서 상승했다.
- 문서 이미지 분류에서는 96.08 정확도를 기록하여 LayoutLM의 94.43보다 뚜렷한 향상이 있었다.
- 모델은 모든 세 가지 벤치마크 데이터셋에서 강력한 기준 모델을 능가하며, 셀 수준의 레이아웃 모델링의 효과성을 입증했다.
- 정성 분석 결과, StructuralLM는 'Call Connie Drath or Carol Musgrave at 800/424-9876'처럼 동일한 셀에서 온 전체 엔티티를 단일 단위로 올바르게 예측하는 반면, LayoutLM는 이를 분리하여 처리하는 것으로 나타났다.
- 제거 분석 결과, 셀 수준의 2D 위치 임베딩과 셀 위치 분류 목표 모두 성능 향상에 기여하는 것으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.