Skip to main content
QUICK REVIEW

[論文レビュー] LGPMA: Complicated Table Structure Recognition with Local and Global Pyramid Mask Alignment

Qiao Liang, Zaisheng Li|arXiv (Cornell University)|May 13, 2021
Handwritten Text Recognition Techniques参考文献 40被引用数 8
ひとこと要約

LGPMAは、局所的およびグローバルなピラミッドマスク学習を統合することで、複雑なテーブル構造認識のための新規フレームワークを提案する。これにより、特に挑戦的な空セルを含むテーブルセルのより正確なアラインドバウンディングボックスが生成される。再スコアリングモジュールを用いて局所的テキスト領域検出とグローバルセルレイアウトセグメンテーションを共同最適化することで、LGPMAは公開ベンチマークで最先端の性能を達成し、アラインドバウンディングボックス検出が3.1%向上し、TEDS-Strucが0.59ポイント向上した。

ABSTRACT

Table structure recognition is a challenging task due to the various structures and complicated cell spanning relations. Previous methods handled the problem starting from elements in different granularities (rows/columns, text regions), which somehow fell into the issues like lossy heuristic rules or neglect of empty cell division. Based on table structure characteristics, we find that obtaining the aligned bounding boxes of text region can effectively maintain the entire relevant range of different cells. However, the aligned bounding boxes are hard to be accurately predicted due to the visual ambiguities. In this paper, we aim to obtain more reliable aligned bounding boxes by fully utilizing the visual information from both text regions in proposed local features and cell relations in global features. Specifically, we propose the framework of Local and Global Pyramid Mask Alignment, which adopts the soft pyramid mask learning mechanism in both the local and global feature maps. It allows the predicted boundaries of bounding boxes to break through the limitation of original proposals. A pyramid mask re-scoring module is then integrated to compromise the local and global information and refine the predicted boundaries. Finally, we propose a robust table structure recovery pipeline to obtain the final structure, in which we also effectively solve the problems of empty cells locating and division. Experimental results show that the proposed method achieves competitive and even new state-of-the-art performance on several public benchmarks.

研究の動機と目的

  • 複雑なセルのマージンと曖昧な空セルを有するテーブル構造を認識する課題に対処すること。
  • 局所的テクスチャとグローバルレイアウトの両方の特徴を活用して、アラインドバウンディングボックス予測の信頼性を向上させること。
  • 従来の手法でしばしば無視される空セルの検出と分割を効果的に行う統合パイプラインを開発すること。
  • 高コストで不安定な複雑なレイアウトで問題を引き起こすヒューリスティックルールやGNNベースのアプローチの制限を克服すること。
  • 特にクロス行/列セルおよび空セルの分割を扱う際のテーブル構造認識の最先端の性能を達成すること。

提案手法

  • 局所的テキスト領域検出に適した「局所的ピラミッドマスクアライメント(LPMA)」と、全体的なセルレイアウト理解に適した「グローバルピラミッドマスクアライメント(GPMA)」の二重ブランチネットワークを提案する。
  • 初期の提案を超える柔軟な境界予測を可能にするために、局所的およびグローバルブランチの両方でソフトピラミッドマスクの監視を採用する。
  • 局所的およびグローバル特徴を統合してアラインドバウンディングボックス予測を精緻化する、ピラミッドマスク再スコアリングモジュールを導入する。
  • GPMAからの視覚的手がかりを活用して知能的な空セルマージングを実行する、堅牢なテーブル構造回復パイプラインを設計する。
  • 相対的な関係に基づく従来の損失関数よりも一般化性能が向上する絶対的なセルカバレッジを考慮する新しいアライメント損失を活用する。
  • 初期検出のためのバックボーンとしてMask R-CNNを用い、局所化の向上に寄与するマルチスケール特徴学習を強化する。

実験結果

リサーチクエスチョン

  • RQ1複雑なセルマージンと視覚的曖昧性を有するテーブルにおいて、アラインドバウンディングボックス検出の正確性をどのように向上させられるか?
  • RQ2局所的テクスチャ認識とグローバルレイアウト推論を組み合わせることで、テーブル構造認識の耐障害性が向上するか?
  • RQ3複数行/列セルと視覚的に類似した空セルを効果的に検出し、分割するにはどうすればよいか?
  • RQ4局所的およびグローバル特徴を共同で学習する統合フレームワークは、ヒューリスティックルールやGNNに依存する手法を上回るか?
  • RQ5標準のMask R-CNNと比較して、提案されたピラミッドマスク再スコアリング機構は境界局所化をどの程度改善するか?

主な発見

  • LGPMAは、ベースラインのMask R-CNNと比較して、アラインドバウンディングボックス検出のH-meanを3.1%向上させた。
  • この手法はTEDS-Strucを0.59ポイント向上させ、公開ベンチマークで最先端の性能を示した。
  • 提案された空セルマージング戦略は、70.21%のH-meanを達成し、最小および最大セルマージングのベースラインを上回った。
  • 正例の非空アラインドボックスが与えられた場合、テーブル回復パイプラインはすべてのアラインドボックスで99.87%のH-meanを達成し、その堅牢性を証明した。
  • アブレーションスタディの結果、LPMA、GPMA、および再スコアリングモジュールを組み合わせた場合が最良の性能を示し、アライメント損失のみを用いる場合を上回った。
  • この手法はテキスト領域検出およびアラインドボックス検出の両方で一貫した向上を示しており、改善が特定のコンponentに限定されていないことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。