Skip to main content
QUICK REVIEW

[論文レビュー] DocLayNet: A Large Human-Annotated Dataset for Document-Layout Analysis

B. Pfitzmann, Christoph Auer|arXiv (Cornell University)|Jun 2, 2022
Handwritten Text Recognition Techniques被引用数 10
ひとこと要約

この論文では、11種類の詳細なレイアウトクラスラベルを備えた80,863枚の多様なドキュメントページから構成される大規模で人間によるアノテーションが施されたデータセット、DocLayNetを紹介する。このデータセットで訓練されたオブジェクト検出モデルは、PubLayNet や DocBank で訓練されたモデルと比較して、多様なレイアウトにおいてはるかに頑健な性能を示す。モデルの正確性と人間アノテーター間の一致度の間には10%の差があるが、これはさらなる改善の余地があることを示している。

ABSTRACT

Accurate document layout analysis is a key requirement for high-quality PDF document conversion. With the recent availability of public, large ground-truth datasets such as PubLayNet and DocBank, deep-learning models have proven to be very effective at layout detection and segmentation. While these datasets are of adequate size to train such models, they severely lack in layout variability since they are sourced from scientific article repositories such as PubMed and arXiv only. Consequently, the accuracy of the layout segmentation drops significantly when these models are applied on more challenging and diverse layouts. In this paper, we present extit{DocLayNet}, a new, publicly available, document-layout annotation dataset in COCO format. It contains 80863 manually annotated pages from diverse data sources to represent a wide variability in layouts. For each PDF page, the layout annotations provide labelled bounding-boxes with a choice of 11 distinct classes. DocLayNet also provides a subset of double- and triple-annotated pages to determine the inter-annotator agreement. In multiple experiments, we provide baseline accuracy scores (in mAP) for a set of popular object detection models. We also demonstrate that these models fall approximately 10\% behind the inter-annotator agreement. Furthermore, we provide evidence that DocLayNet is of sufficient size. Lastly, we compare models trained on PubLayNet, DocBank and DocLayNet, showing that layout predictions of the DocLayNet-trained models are more robust and thus the preferred choice for general-purpose document-layout analysis.

研究の動機と目的

  • PubLayNet や DocBank のように、均一なテンプレートを持つ科学リポジトリから抽出されたデータセットに限られたレイアウトの多様性がある問題に対処する。
  • ドキュメントタイプとレイアウトの多様性に富んだ大規模で人間によるアノテーションが施されたデータセットを提供し、レイアウトセグメンテーションモデルの訓練と評価をより良く行う。
  • 多様なレイアウト分布における最先端のオブジェクト検出モデルの信頼性のあるベースラインパフォーマンス指標を確立する。
  • 人間のアノテーション一致度とモデルのパフォーマンスの差を定量化し、レイアウト理解における課題を浮き彫りにする。
  • DocLayNet で訓練されたモデルが、より均質なデータセットで訓練されたモデルと比較して、多様なドキュメントタイプに優れた一般化性能を示すことを示す。

提案手法

  • データセットは大規模な人間によるアノテーションキャンペーンを通じて構築され、80,863枚の固有のドキュメントページが、11種類の異なるレイアウトクラスを用いて COCO 形式でアノテーションされた。
  • 二重・三重アノテーションが施されたページのサブセットを用いて、アノテータ間の一貫性を計算し、アノテーション品質を評価した。
  • データ漏洩を防ぎ、クラスの代表比を保つために、事前に定義された重複のない訓練・検証・テスト分割がデータセットに含まれている。
  • マスクR-CNNにResNet-50を組み合わせたベースラインモデルを、DocLayNet、PubLayNet、DocBankの各データセットで訓練・評価し、比較分析を行った。
  • データ分割戦略(ページ単位 vs. ドキュメント単位)がモデルのパフォーマンス指標に与える影響を評価するためのアブレーションスタディを実施した。
  • 共通のラベルクラスを対象に、各データセット間でモデルの微調整と評価を行い、一般化性能を比較した。

実験結果

リサーチクエスチョン

  • RQ1DocLayNetにおけるレイアウトの多様性は、PubLayNet や DocBank などの既存のデータセットと比較してどう異なるのか。また、これによりモデルの一般化性能にどのような影響を与えるのか。
  • RQ2DocLayNetにおけるレイアウトアノテーションのアノテータ間一致度はどの程度か。また、モデルの予測精度と比較するとどうなるか。
  • RQ3DocLayNet で訓練されたモデルは、非科学的ドキュメントレイアウトの未観測データに対して、PubLayNet や DocBank で訓練されたモデルと比較して、より優れた一般化性能を示すのか。
  • RQ4ページ単位の分割とドキュメント単位の分割という異なるデータ分割戦略が、モデルのmAPスコアの評価にどのように影響するのか。
  • RQ5人間のアノテーターと機械学習モデルとの間には、ドキュメントレイアウト分析においてどの程度のパフォーマンスギャップが存在するのか。

主な発見

  • DocLayNet で訓練されたモデルは、自らのテストセットで平均適合率(mAP)が78を達成し、同じテストセットで評価された PubLayNet や DocBank で訓練されたモデルと比較して顕著に優れた性能を示した。
  • DocLayNet で訓練されたモデルと人間のアノテータ間の一致度との間には約10%のギャップがあるが、これはモデルが人間レベルの理解にまだ追いついていないことを示している。
  • ページ単位のデータ分割はドキュメント単位の分割よりも約10%高いmAPスコアをもたらし、不適切な分割戦略によりモデルパフォーマンスが過大評価されるリスクを浮き彫りにしている。
  • DocLayNet で訓練されたモデルは、PubLayNet や DocBank で訓練されたモデルと比較して、異なるデータセット(PubLayNet、DocBank、DocLayNet)において一貫性のあるパフォーマンスを示しており、優れた一般化性能を示している。
  • DocLayNet で訓練されたモデルは、DocLayNet テストセットにおいて、Text クラスでmAPが84、Table クラスで82を達成し、他のデータセットで訓練されたモデルよりも優れたパフォーマンスを示した。
  • 本研究は、DocLayNet が将来的なドキュメントレイアウト分析分野の研究のベンチマークとして十分に大規模かつ多様性に富んでいることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。