Skip to main content
QUICK REVIEW

[論文レビュー] CDeC-Net: Composite Deformable Cascade Network for Table Detection in Document Images

Madhav Agarwal, Ajoy Mondal|arXiv (Cornell University)|Aug 25, 2020
Handwritten Text Recognition Techniques参考文献 50被引用数 5
ひとこと要約

CDeC-Netは、文書画像における正確なテーブル検出のための、二重バックボーンと可変畳み込みを備えた、エンドツーエンドで学習可能な段階的Mask R-CNNアーキテクチャである。複数のベンチマークで最先端の性能を達成しており、きびしいIoU閾値下でも高いmAPを示し、各データセットごとの再トレーニングなしに多様なデータセットにうまく一般化する、1つの最適化済みモデル(CDeC-Net‡)を導入している。

ABSTRACT

Localizing page elements/objects such as tables, figures, equations, etc. is the primary step in extracting information from document images. We propose a novel end-to-end trainable deep network, (CDeC-Net) for detecting tables present in the documents. The proposed network consists of a multistage extension of Mask R-CNN with a dual backbone having deformable convolution for detecting tables varying in scale with high detection accuracy at higher IoU threshold. We empirically evaluate CDeC-Net on all the publicly available benchmark datasets - ICDAR-2013, ICDAR-2017, ICDAR-2019,UNLV, Marmot, PubLayNet, and TableBank - with extensive experiments. Our solution has three important properties: (i) a single trained model CDeC-Net‡ performs well across all the popular benchmark datasets; (ii) we report excellent performances across multiple, including higher, thresholds of IoU; (iii) by following the same protocol of the recent papers for each of the benchmarks, we consistently demonstrate the superior quantitative performance. Our code and models will be publicly released for enabling the reproducibility of the results.

研究の動機と目的

  • 複数の異なるドキュメント画像データセットで良好に動作する、1つの汎用的なディーパンラーニングモデルを構築すること。
  • 複雑なレイアウトにおける誤検出を低減するため、高いIoU閾値での検出精度を向上させること。
  • 既存のモデルがデータセット固有の再トレーニングやファインチューニングを必要としているという制限を克服すること。
  • 可変畳み込みと二重バックボーンを段階的Mask R-CNNフレームワークに統合し、変動するテーブルレイアウトにおけるより良い特徴学習を実現すること。
  • 一貫した評価プロトコルに従って、複数の公開データセットで優れた性能を示すことで、テーブル検出の新しいベンチマークを確立すること。

提案手法

  • 段階的なMask R-CNNアーキテクチャを採用し、オブジェクト候補を段階的に改善することで、局所化精度を向上させる。
  • 異なるスケールのテーブルの特徴表現を強化するため、ResNeXt-101と可変畳み込みを備えた第二のストリームを組み合わせた二重バックボーンを採用する。
  • バックボーンに可変畳み込みを統合し、関連する空間領域に適応的に注目することで、レイアウトの変動や欠落した罫線に対しても耐性を高める。
  • IIIT-AR-13Kデータセットで学習し、各ベンチマークデータセットのトレーニングスプリットでファインチューニングすることで、1つの汎用モデル(CDeC-Net‡)を生成する。
  • 近年の最先端論文に準拠した標準的な評価プロトコルに従い、複数のデータセット間での公平かつ一貫性のある比較を実現する。
  • エンドツーエンドで学習可能であり、特に困難な高IoU閾値(例:0.8)を最適化するために設計されている。
Figure 1: Illustration of the proposed cd e c-n et which is compose of cascade Mask r-cnn with composite backbone having deformable convolution instead of conventional convolution.
Figure 1: Illustration of the proposed cd e c-n et which is compose of cascade Mask r-cnn with composite backbone having deformable convolution instead of conventional convolution.

実験結果

リサーチクエスチョン

  • RQ1データセット固有の再トレーニングなしに、複数の多様なテーブル検出ベンチマークで最先端の性能を達成できる1つのディーパンラーニングモデルは可能か?
  • RQ2可変畳み込みと二重バックボーンの統合は、特に高いIoU閾値での検出精度をどのように向上させるか?
  • RQ3段階的Mask R-CNNアーキテクチャは、視覚的に類似したオブジェクトが多数存在する複雑なドキュメントレイアウトにおいて、誤検出をどの程度低減できるか?
  • RQ4大規模かつ多様なデータセット(IIIT-AR-13K)で事前学習したモデルを、未観測のベンチマークでファインチューニングすることで、優れた一般化性能が得られるか?
  • RQ5統一されたモデルは、各ベンチマークに特化して訓練された専用モデルと同等またはそれ以上の性能を発揮できるか?

主な発見

  • CDeC-Net‡(1つのファインチューニング済みモデル)は、PublayNetでmAP 0.978を達成し、以前の最先端手法(m-RCNN)の0.960を上回った。
  • ICDAR-2019データセットでは、IoU=0.8でF1スコア0.950を達成し、高いIoU閾値下でも優れた性能を示した。
  • ICDAR-2013データセットでは、F1スコア0.968を達成し、最高性能を示したモデル(dCnt)の0.996に非常に近い結果を出したが、これは1つのモデルであるにもかかわらずの成果である。
  • UNLVデータセットでは、mAP 0.912を達成し、以前のSOTA(God)の0.910をわずかに上回った。
  • TableBankデータセットでは、mAP 0.965を達成し、以前のSOTA(Li et al.)の0.981に非常に近い結果を出したが、すべてのデータセットで1つのモデルを維持した。
  • アブレーションスタディにより、段階的Mask R-CNNフレームワークに二重バックボーンと可変畳み込みを統合することで、IoU=0.5におけるF1スコアが最大の1.000に達することが確認された。
Figure 2: Illustration of the deformable convolution.
Figure 2: Illustration of the deformable convolution.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。