Skip to main content
QUICK REVIEW

[논문 리뷰] DocLayNet: A Large Human-Annotated Dataset for Document-Layout Analysis

B. Pfitzmann, Christoph Auer|arXiv (Cornell University)|2022. 06. 02.
Handwritten Text Recognition Techniques인용 수 10
한 줄 요약

이 논문은 11개의 세부 레이아웃 클래스 레이블을 가진 80,863개의 다양한 문서 페이지로 구성된 대규모 인간 레이블링 데이터셋인 DocLayNet을 소개한다. 이는 문서 레이아웃 분석을 향상시키기 위해 설계되었다. 이 데이터셋으로 훈련된 객체 검출 모델은 PubLayNet이나 DocBank로 훈련된 모델보다 다양한 레이아웃에서 훨씬 더 강력한 성능을 보이며, 모델 정확도와 인간 간 일致도 사이에 약 10%의 격차가 존재해 향상 여지를 보여준다.

ABSTRACT

Accurate document layout analysis is a key requirement for high-quality PDF document conversion. With the recent availability of public, large ground-truth datasets such as PubLayNet and DocBank, deep-learning models have proven to be very effective at layout detection and segmentation. While these datasets are of adequate size to train such models, they severely lack in layout variability since they are sourced from scientific article repositories such as PubMed and arXiv only. Consequently, the accuracy of the layout segmentation drops significantly when these models are applied on more challenging and diverse layouts. In this paper, we present extit{DocLayNet}, a new, publicly available, document-layout annotation dataset in COCO format. It contains 80863 manually annotated pages from diverse data sources to represent a wide variability in layouts. For each PDF page, the layout annotations provide labelled bounding-boxes with a choice of 11 distinct classes. DocLayNet also provides a subset of double- and triple-annotated pages to determine the inter-annotator agreement. In multiple experiments, we provide baseline accuracy scores (in mAP) for a set of popular object detection models. We also demonstrate that these models fall approximately 10\% behind the inter-annotator agreement. Furthermore, we provide evidence that DocLayNet is of sufficient size. Lastly, we compare models trained on PubLayNet, DocBank and DocLayNet, showing that layout predictions of the DocLayNet-trained models are more robust and thus the preferred choice for general-purpose document-layout analysis.

연구 동기 및 목표

  • PubLayNet과 DocBank처럼 과학 자료소스에서 유래된 일관된 템플릿을 가진 기존 데이터셋의 레이아웃 다양성 부족 문제를 해결하기 위해.
  • 다양한 문서 유형과 레이아웃을 포함한 대규모 인간 레이블링 데이터셋을 제공하여 레이아웃 세그멘테이션 모델의 훈련과 평가를 더 잘할 수 있도록 하기 위해.
  • 다양한 레이아웃 분포에서 최신 객체 검출 모델의 신뢰할 수 있는 기준 성능 지표를 설정하기 위해.
  • 인간 레이블링 일치도와 모델 성능 간 격차를 정량화하여 레이아웃 이해의 과제를 부각시키기 위해.
  • DocLayNet으로 훈련된 모델이 더 균일한 데이터셋으로 훈련된 모델보다 다양한 문서 유형에 더 잘 일반화됨을 보여주기 위해.

제안 방법

  • 데이터셋은 대규모 인간 레이블링 캠페인을 통해 구축되었으며, 11개의 고유한 레이아웃 클래스를 사용해 COCO 형식으로 80,863개의 고유한 문서 페이지가 레이블링되었다.
  • 이중 및 삼중 레이블링된 페이지의 일부를 활용해 인간 간 일치도를 계산하고 레이블링 품질을 평가하였다.
  • 데이터 유출을 방지하고 클래스 비율이 균형을 이루도록 사전 정의된 겹치지 않는 훈련, 검증, 테스트 분할을 포함한다.
  • Mask R-CNN에 ResNet-50를 사용한 기준 모델을 DocLayNet, PubLayNet, DocBank에서 훈련하고 평가하여 비교 분 析를 수행하였다.
  • 데이터 분할 전략(페이지 기반 vs. 문서 기반)이 모델 성능 지표에 미치는 영향을 평가하기 위해 분석 실험을 수행하였다.
  • 다양한 데이터셋 간 공통 레이블 클래스에서 모델을 미세조정하고 평가하여 일반화 성능을 비교하였다.

실험 결과

연구 질문

  • RQ1DocLayNet의 레이아웃 다양성은 PubLayNet과 DocBank와 비교해 어떻게 다른가? 이는 모델 일반화에 어떤 영향을 미치는가?
  • RQ2DocLayNet에서 레이아웃 레이블링에 대한 인간 간 일치도는 얼마이며, 모델 예측 정확도와 비교해보면 어떠한가?
  • RQ3DocLayNet으로 훈련된 모델은 과학 문서 외의 새로운 레이아웃에 대해 PubLayNet이나 DocBank로 훈련된 모델보다 더 나은 일반화 성능을 보일까?
  • RQ4다른 데이터 분할 전략(페이지 기반 vs. 문서 기반)은 모델 mAP 점수 평가에 어떤 영향을 미치는가?
  • RQ5문서 레이아웃 분석에서 인간 레이블러와 기계 학습 모델 간의 성능 격차는 얼마인가?

주요 결과

  • DocLayNet으로 훈련된 모델은 자체 테스트 세트에서 평균 정밀도(mAP) 78을 달성하여, 동일 세트에서 평가된 PubLayNet 및 DocBank로 훈련된 모델보다 유의미하게 높은 성능을 보였다.
  • DocLayNet으로 훈련된 모델과 인간 간 일치도 사이의 성능 격차는 약 10%로, 모델이 여전히 인간 수준의 이해에 뒤쳐지고 있음을 시사한다.
  • 페이지 기반 데이터 분할은 문서 기반 분할보다 약 10% 높은 mAP 점수를 기록하여, 부적절한 분할 전략이 모델 성능을 과대평가할 수 있음을 보여준다.
  • DocLayNet으로 훈련된 모델은 PubLayNet, DocBank, DocLayNet 등 다양한 데이터셋에서 더 일관된 성능을 보이며, PubLayNet이나 DocBank로 훈련된 모델보다 뛰어난 일반화 능력을 보여준다.
  • DocLayNet 테스트 세트에서 DocLayNet으로 훈련된 모델은 Text 클래스에서 mAP 84, Table 클래스에서 mAP 82를 기록하여 다른 데이터셋으로 훈련된 모델보다 이들 공통 레이블에서 뛰어난 성능을 보였다.
  • 본 연구는 DocLayNet이 향후 문서 레이아웃 분석 분야의 연구를 위한 벤치마크로 충분히 크고 다양하다는 것을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.