Skip to main content
QUICK REVIEW

[論文レビュー] M$^{6}$Doc: A Large-Scale Multi-Format, Multi-Type, Multi-Layout, Multi-Language, Multi-Annotation Category Dataset for Modern Document Layout Analysis

Hiuyi Cheng, Peirong Zhang|arXiv (Cornell University)|May 15, 2023
Handwritten Text Recognition Techniques被引用数 5
ひとこと要約

本稿では、複数のフォーマット(スキャン済み、写真、PDF)、種別(学術論文、雑誌、試験用紙など)、レイアウト(長方形、マンハッタン、非マンハッタン、多カラム)、言語(中国語および英語)をカバーする、大規模かつ多様なドキュメントレイアウト解析のためのデータセット M$^{6}$Doc を紹介する。9,080 ページにわたり74の細分化されたアノテーションカテゴリを含む。また、アダプティブな要因マッチングとセグメンテーションブランチを備えたトランスフォーマー基盤のモデルである TransDLANet を提案し、M$^{6}$Doc で 64.5% の mAP を達成し、レイアウト解析分野における新たな最先端性能を確立した。

ABSTRACT

Document layout analysis is a crucial prerequisite for document understanding, including document retrieval and conversion. Most public datasets currently contain only PDF documents and lack realistic documents. Models trained on these datasets may not generalize well to real-world scenarios. Therefore, this paper introduces a large and diverse document layout analysis dataset called $M^{6}Doc$. The $M^6$ designation represents six properties: (1) Multi-Format (including scanned, photographed, and PDF documents); (2) Multi-Type (such as scientific articles, textbooks, books, test papers, magazines, newspapers, and notes); (3) Multi-Layout (rectangular, Manhattan, non-Manhattan, and multi-column Manhattan); (4) Multi-Language (Chinese and English); (5) Multi-Annotation Category (74 types of annotation labels with 237,116 annotation instances in 9,080 manually annotated pages); and (6) Modern documents. Additionally, we propose a transformer-based document layout analysis method called TransDLANet, which leverages an adaptive element matching mechanism that enables query embedding to better match ground truth to improve recall, and constructs a segmentation branch for more precise document image instance segmentation. We conduct a comprehensive evaluation of $M^{6}Doc$ with various layout analysis methods and demonstrate its effectiveness. TransDLANet achieves state-of-the-art performance on $M^{6}Doc$ with 64.5% mAP. The $M^{6}Doc$ dataset will be available at https://github.com/HCIILAB/M6Doc.

研究の動機と目的

  • 現実世界のシナリオにおけるドキュメントレイアウト解析のための、現実的で多様かつ細分化されたデータセットの不足を解消すること。
  • 既存のデータセットに見られる制限(主に PDF に限定されたフォーマット、主に英語のみの言語対応、粗いアノテーションカテゴリ)を克服すること。
  • 複数のドキュメント種別、フォーマット、言語をカバーする、レイアウト解析モデルの評価のための包括的なベンチマークを構築すること。
  • 複雑な現実世界のドキュメントレイアウトを処理できる汎用的でマルチドメインのレイアウト解析モデルの訓練と評価を可能にすること。

提案手法

  • 9,080 ページにわたる手作業によるアノテーションを含む大規模データセット M$^{6}$Doc を提案。ドキュメント種別は9種、レイアウトタイプは4種、言語は2種、アノテーションカテゴリは74種。
  • 位置情報符号化なしの標準的なトランスフォーマー エンコーダーを用いた、トランスフォーマー基盤のモデルである TransDLANet を導入。
  • クエリ埋め込みと正例との一致を向上させることで再現率を向上させ、重複した注目を低減するためのアダプティブな要因マッチング機構を採用。
  • RoI 特徴量と画像特徴量を統合するためのダイナミックデコーダーを用いて、より優れた特徴表現を実現。
  • インスタンスセグメンテーションにおけるマルチタスク学習を実現するため、3つのパラメータ共有型多層パーセプトロン(MLP)ブランチを配置。
  • インスタンスセグメンテーションを基盤とすることで、レイアウト要因の正確な局所化を実現するセグメンテーションブランチを設置。

実験結果

リサーチクエスチョン

  • RQ1現実世界のドキュメントフォーマット(スキャン済み、写真、PDF)を含む大規模かつ多様なデータセットは、レイアウト解析モデルの一般化性能を向上させ得るか?
  • RQ2中国語と英語の両言語対応は、クロスリンガルなシナリオにおけるレイアウト解析モデルの性能と頑健性にどのような影響を及ぼすか?
  • RQ3トランスフォーマー基盤のアーキテクチャにアダプティブな要因マッチング機構を導入することで、レイアウト要因検出における再現率の向上と重複注目の低減はどの程度達成可能か?
  • RQ4多様なドキュメント種別とレイアウトを統合的に学習した統合モデルは、複数のベンチマークで最先端の性能を達成できるか?
  • RQ574 カテゴリの細分化アノテーションは、粗いデータセットと比較して、レイアウト理解の正確性と詳細さをどの程度向上させるか?

主な発見

  • M$^{6}$Doc は、現実世界の(スキャン済みおよび写真撮影済み)および生デジタル(PDF)ドキュメントを両方含む最初のデータセットであり、ドキュメント種別、レイアウト、言語の面で包括的なカバレッジを有する。
  • 9,080 ページにわたり237,116 個のアノテーションインスタンスを含み、74 の細分化されたアノテーションカテゴリを有する。これは、これまでで最も詳細な手作業アノテーションを施された DLA データセットである。
  • TransDLANet は M$^{6}$Doc で 64.5% の mAP を達成し、ドキュメントレイアウト解析分野における新たな最先端性能を確立した。
  • TransDLANet に組み込まれたアダプティブな要因マッチング機構により、クエリ埋め込みが正例インスタンスとよりよく一致するようになり、再現率が向上した。
  • TransDLANet のセグメンテーションブランチにより、レイアウト要因のより正確なインスタンスセグメンテーションが可能になり、局所化精度が向上した。
  • 複数のデータセット(例:試験用紙、雑誌、ノート)にわたる包括的な評価により、TransDLANet が多様なドキュメントレイアウトに対して頑健で一般化可能な性能を示すことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。