Skip to main content
QUICK REVIEW

[論文レビュー] Table Structure Recognition using Top-Down and Bottom-Up Cues

Sachin Raja, Ajoy Mondal|arXiv (Cornell University)|Oct 9, 2020
Handwritten Text Recognition Techniques参考文献 54被引用数 9
ひとこと要約

本論文では、OCR や PDF のメタ特徴量に依存せずに、ドキュメント画像内のテーブル構造を認識するエンドツーエンドのディーブラーニングフレームワークである TabStruct-Net を提案する。トップダウンによるセル検出とボトムアップによる構造的関連付けを統合することで、複雑なレイアウトにおける視覚的テーブル構造認識の分野で最先端の性能を達成した。アライメントに配慮した損失関数とグラフベースのセル関連付けを組み合わせることで、複数のベンチマークデータセットで最先端の性能を発揮し、視覚的テーブル構造認識の新たな基準を確立した。

ABSTRACT

Tables are information-rich structured objects in document images. While significant work has been done in localizing tables as graphic objects in document images, only limited attempts exist on table structure recognition. Most existing literature on structure recognition depends on extraction of meta-features from the PDF document or on the optical character recognition (OCR) models to extract low-level layout features from the image. However, these methods fail to generalize well because of the absence of meta-features or errors made by the OCR when there is a significant variance in table layouts and text organization. In our work, we focus on tables that have complex structures, dense content, and varying layouts with no dependency on meta-features and/or OCR. We present an approach for table structure recognition that combines cell detection and interaction modules to localize the cells and predict their row and column associations with other detected cells. We incorporate structural constraints as additional differential components to the loss function for cell detection. We empirically validate our method on the publicly available real-world datasets - ICDAR-2013, ICDAR-2019 (cTDaR) archival, UNLV, SciTSR, SciTSR-COMP, TableBank, and PubTabNet. Our attempt opens up a new direction for table structure recognition by combining top-down (table cells detection) and bottom-up (structure recognition) cues in visually understanding the tables.

研究の動機と目的

  • スキャンされたドキュメント画像における視覚的に多様な複雑なテーブル構造を、OCR や PDF のメタ特徴量に依存せずに認識する課題に対処すること。
  • セルのアラインメント、ボーダー、空間的関係といった視覚的手がかりをモデル化することで、テーブル構造認識の一般化性能を向上させること。
  • セル検出と構造的関連付けを同時に最適化できるエンドツーエンドでトレーニング可能なアーキテクチャを構築すること。
  • マルチロウ/マルチカラムセル、濃いコンテンツ、一貫性のない罫線を含むテーブルの堅牢な認識を可能にすること。
  • トップダウン検出とボトムアップ的構造的推論を統合することで、テーブル構造認識の新しいパラダイムを確立すること。

提案手法

  • ドキュメント画像内のセルを検出するためのマスク R-CNN を用いたトップダウンアプローチを採用し、その後にボトムアップによるテーブル構造の再構築を実行する。
  • 隣接セル間の空間的アラインメント制約を強制することで、セル検出を正則化する新しいアライメント損失関数の導入。
  • 各検出セルの中心水平線および中心垂直線に沿った視覚的特徴をモデル化するため、FPN の P2 層の特徴マップと LSTMs を使用する。
  • 隣接行列を用いて、検出セル間の行および列の関連付けをグラフベースで定式化する。
  • マルチタスク学習により、セル検出と構造認識の両方を同時に最適化するエンドツーエンドでの訓練。
  • 検出と構造的推論の両方のための特徴表現を強化するため、FPN にトップダウンおよびボトムアップパスを統合する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、OCR や PDF のメタ特徴量に依存せずに、複雑なテーブル構造を認識できるか?
  • RQ2トップダウンによるセル検出とボトムアップによる構造的関連付けを統合することで、テーブル構造認識の性能はどの程度向上するか?
  • RQ3アライメントに配慮した損失関数は、セル検出およびその後の構造認識の性能をどの程度向上させるか?
  • RQ4中間の FPN 層の特徴量と LSTMs を用いることで、困難なテーブルレイアウトにおける性能にどのような影響を与えるか?
  • RQ5検出と構造的関連付けのエンドツーエンドでの共同訓練は、全体の F1 スコア向上にどの程度寄与するか?

主な発見

  • ICDAR-2019(cTDaR)アーカイブデータセットでは、TabStruct-Net はフル構成(Mask R-CNN + td+bu+al + dgcnn + P2 + LSTM)で F1 スコア 0.966 を達成し、先行手法を上回った。
  • UNLV-partial データセットでは、構造認識の F1 スコアが 0.920 に達し、現実世界の複雑なテーブルにおいても優れた一般化性能を示した。
  • SciTSR データセットでは、構造認識の F1 スコアが 0.935 に達し、多様なテーブルレイアウトおよびコンテンツ密度にわたる堅牢性を確認した。
  • アブレーションスタディの結果、アライメント損失(AL)の追加および P2 層の特徴量に LSTMs を組み合わせることで、検出および構造認識の両方の性能が顕著に向上した。
  • FPN におけるトップダウンおよびボトムアップパスの統合(td+bu)により、全データセットで F1 スコアが 0.5–1.5% 一貫して向上した。
  • ICDAR-2013、ICDAR-2019、UNLV、SciTSR、TableBank を含む全評価ベンチマークで最先端の性能を達成し、一般化能力の妥当性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。