Skip to main content
QUICK REVIEW

[논문 리뷰] M$^{6}$Doc: A Large-Scale Multi-Format, Multi-Type, Multi-Layout, Multi-Language, Multi-Annotation Category Dataset for Modern Document Layout Analysis

Hiuyi Cheng, Peirong Zhang|arXiv (Cornell University)|2023. 05. 15.
Handwritten Text Recognition Techniques인용 수 5
한 줄 요약

이 논문은 다양한 형식(스캔, 촬영, PDF), 유형(학술 논문, 잡지, 시험지 등), 레이아웃(직사각형, 맨하탄, 비맨하탄, 다중 컬럼), 언어(중국어 및 영어)를 포함하는 현대 문서 레이아웃 분석을 위한 대규모이고 다양한 데이터셋인 M$^{6}$Doc를 소개한다. 이 데이터셋은 9,080페이지에 걸쳐 74개의 세분화된 주석 카테고리로 구성되어 있으며, TransDLANet라는 트랜스포머 기반 모델을 제안하여 M$^{6}$Doc에서 64.5% mAP를 달성하여 새로운 최고 성능을 기록한다.

ABSTRACT

Document layout analysis is a crucial prerequisite for document understanding, including document retrieval and conversion. Most public datasets currently contain only PDF documents and lack realistic documents. Models trained on these datasets may not generalize well to real-world scenarios. Therefore, this paper introduces a large and diverse document layout analysis dataset called $M^{6}Doc$. The $M^6$ designation represents six properties: (1) Multi-Format (including scanned, photographed, and PDF documents); (2) Multi-Type (such as scientific articles, textbooks, books, test papers, magazines, newspapers, and notes); (3) Multi-Layout (rectangular, Manhattan, non-Manhattan, and multi-column Manhattan); (4) Multi-Language (Chinese and English); (5) Multi-Annotation Category (74 types of annotation labels with 237,116 annotation instances in 9,080 manually annotated pages); and (6) Modern documents. Additionally, we propose a transformer-based document layout analysis method called TransDLANet, which leverages an adaptive element matching mechanism that enables query embedding to better match ground truth to improve recall, and constructs a segmentation branch for more precise document image instance segmentation. We conduct a comprehensive evaluation of $M^{6}Doc$ with various layout analysis methods and demonstrate its effectiveness. TransDLANet achieves state-of-the-art performance on $M^{6}Doc$ with 64.5% mAP. The $M^{6}Doc$ dataset will be available at https://github.com/HCIILAB/M6Doc.

연구 동기 및 목표

  • 실세계 시나리오에서 문서 레이아웃 분석을 위한 현실적이고 다양한, 세분화된 데이터셋의 부족을 해결하기 위해.
  • 기존 데이터셋의 한계(주로 PDF 형식에 국한된 제한된 형식, 주로 영어 지원, 굵은 주석 카테고리)를 극복하기 위해.
  • 다양한 문서 유형, 형식, 언어를 아우르는 레이아웃 분석 모델 평가를 위한 종합적인 벤치마크를 제공하기 위해.
  • 복잡한 실세계 문서 레이아웃을 다룰 수 있는 일반화 가능하고 다중 영역의 레이아웃 분석 모델을 훈련 및 평가할 수 있도록 하기 위해.

제안 방법

  • 9,080장의 수작업 주석이 적용된 페이지를 포함하는 대규모 데이터셋인 M$^{6}$Doc를 제안하며, 이는 7종류의 문서 유형, 4종류의 레이아웃 유형, 2개의 언어, 74개의 세분화된 주석 카테고리로 구성된다.
  • 기본 트랜스포머 인코더를 사용하지만 위치 인코딩이 없는 방식으로 특징 융합을 위한 트랜스포머 기반 모델인 TransDLANet를 도입한다.
  • 쿼리 임베딩이 정답 인스턴스와 더 잘 일치하도록 하는 적응형 요소 매칭 메커니즘을 활용하여 재현율을 향상시키고 중복 주목을 감소시킨다.
  • RoI 특징과 이미지 특징을 융합하기 위해 동적 디코더를 사용하여 특징 표현을 향상시킨다.
  • 인스턴스 세그멘테이션에서 다중 작업 학습을 위해 세 개의 파rameter 공유 다층 퍼셉트론(MLP) 브랜치를 배치한다.
  • 정확한 레이아웃 요소 국소화를 위해 인스턴스 세그멘테이션에 기반한 세그멘테이션 브랜치를 도입한다.

실험 결과

연구 질문

  • RQ1실세계 문서 형식(스캔, 촬영, PDF 포함)을 포함하는 대규모이고 다양한 데이터셋이 레이아웃 분석 모델의 일반화 능력을 향상시킬 수 있는가?
  • RQ2다국어(중국어 및 영어) 지원이 다국어 환경에서 레이아웃 분석 모델의 성능과 강건성에 어떤 영향을 미치는가?
  • RQ3트랜스포머 아키텍처 내의 적응형 요소 매칭 메커니즘이 레이아웃 요소 검출에서 재현율 향상과 중복 주목 감소에 얼마나 기여하는가?
  • RQ4다양한 문서 유형과 레이아웃을 기반으로 훈련된 통합 모델이 여러 벤치마크에서 최고 성능을 달성할 수 있는가?
  • RQ5세분화된 주석(74개 카테고리)은 더 큰 굵기의 데이터셋에 비해 더 정확하고 세부적인 레이아웃 이해를 어떻게 가능하게 하는가?

주요 결과

  • M$^{6}$Doc는 실세계(스캔 및 촬영) 문서와 빌드된 디지털 문서(PDF)를 모두 포함하는 최초의 데이터셋으로, 문서 유형, 레이아웃, 언어에 대한 포괄적인 커버리지가 이루어져 있다.
  • 9,080페이지에 걸쳐 총 237,116개의 주석 인스턴스가 포함되어 있으며, 74개의 세분화된 주석 카테고리로 구성되어 있어 지금까지 가장 세부적인 수작업 주석이 적용된 DLA 데이터셋이다.
  • TransDLANet는 M$^{6}$Doc에서 64.5% mAP를 달성하여 문서 레이아웃 분석 분야에서 새로운 최고 성능을 기록했다.
  • TransDLANet 내의 적응형 요소 매칭 메커니즘은 쿼리 임베딩이 정답 인스턴스와 더 잘 일치하도록 하여 재현율을 향상시켰다.
  • TransDLANet의 세그멘테이션 브랜치는 레이아웃 요소의 더 정밀한 인스턴스 세그멘테이션을 가능하게 하여 국소화 정확도를 향상시켰다.
  • 다양한 데이터셋(예: 시험지, 잡지, 노트 등)을 대상으로 한 종합적인 평가를 통해 TransDLANet의 강건성과 일반화 능력이 다양한 문서 레이아웃에서 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.