[論文レビュー] TRUST: An Accurate and End-to-End Table structure Recognizer Using Splitting-based Transformers
TRUSTは、クエリベースのスプリッティングモジュールと頂点ガイド付きマージングモジュールを用いて、マルチオントロケーションスプリッティングと頂点ガイド付きマージングに分離する、エンドツーエンドで学習可能なトランスフォーマー基盤のテーブル構造認識手法を提案する。PubTabNetおよびSynthTableで最先端の性能を達成し、10 FPSで動作する。PubTabNetでは97.1%のStructure TEDSと96.2%のTEDsを達成。従来手法に比べ顕著に高速である。
Table structure recognition is a crucial part of document image analysis domain. Its difficulty lies in the need to parse the physical coordinates and logical indices of each cell at the same time. However, the existing methods are difficult to achieve both these goals, especially when the table splitting lines are blurred or tilted. In this paper, we propose an accurate and end-to-end transformer-based table structure recognition method, referred to as TRUST. Transformers are suitable for table structure recognition because of their global computations, perfect memory, and parallel computation. By introducing novel Transformer-based Query-based Splitting Module and Vertex-based Merging Module, the table structure recognition problem is decoupled into two joint optimization sub-tasks: multi-oriented table row/column splitting and table grid merging. The Query-based Splitting Module learns strong context information from long dependencies via Transformer networks, accurately predicts the multi-oriented table row/column separators, and obtains the basic grids of the table accordingly. The Vertex-based Merging Module is capable of aggregating local contextual information between adjacent basic grids, providing the ability to merge basic girds that belong to the same spanning cell accurately. We conduct experiments on several popular benchmarks including PubTabNet and SynthTable, our method achieves new state-of-the-art results. In particular, TRUST runs at 10 FPS on PubTabNet, surpassing the previous methods by a large margin.
研究の動機と目的
- 回転、透視歪み、罫線なし、または空セルを含む複雑なシナリオにおけるテーブル構造の正確な認識に挑戦すること。
- 既存のコンポonentベースおよびシーケンスベースの手法が直面する境界の曖昧さ、一般化性能の低さ、セルレジームレーションの不正確さといった制限を克服すること。
- 行/列スプリッティングとグリッドマージングを同時に最適化するエンドツーエンドのフレームワークを設計し、構造的正確性を向上させること。
- 特に実世界のドキュメント画像シナリオにおいて、高精度を維持しながら高速な推論を達成すること。
提案手法
- 特徴抽出のための畳み込みベースのバックボーンにFPNを用い、その後にトランスフォーマー基盤のエンコーダデコーダアーキテクチャを適用する。
- 角度分類と開始位置回帰を自己注意およびクロス注意を用いて行うことで、マルチオントロケーションの行・列セパレータを予測するクエリベースのスプリッティングモジュールを導入する。
- 予測されたセパレータの交差点(頂点)における特徴を計算し、自己注意を用いて4方向のマージング意思決定を予測する頂点ベースのマージングモジュールを採用する。
- マージングモジュール内で行特徴と列特徴の間でクロス特徴強化を適用し、文脈モデリングおよびマージング正確性を向上させる。
- スプリッティングとマージングの両タスクを統合的に最適化できるように、モデル全体をエンドツーエンドで学習する。
- 視覚的および構造的特徴の間の長距離依存関係をモデル化するため、マルチヘッド自己注意およびクロス注意メカニズムを活用する。
実験結果
リサーチクエスチョン
- RQ1統合的でエンドツーエンドのトランスフォーマー基盤フレームワークは、従来のスプリッティングベース手法に比べ、精度と速度の両面で優れているか?
- RQ2クエリベースのスプリッティングモジュールは、従来のスプリッティングモデルと比較して、マルチオントロケーション、曇り、傾いたテーブルセパレータの処理においてどれほど効果的か?
- RQ3頂点ベースのマージングモジュールは、セルのspanや空セルのマージング正確性を、ヒューリスティック手法や別個のマージングモデルと比較してどの程度向上させるか?
- RQ4マージングモジュールにおけるクロス特徴強化は、透視歪みや欠落線を含む複雑なテーブルにおいて、性能を顕著に向上させるか?
- RQ5提案手法は、PubTabNetやSynthTableといった困難なベンチマークでも、10 FPSというリアルタイム推論を維持しながら高い正確性を達成できるか?
主な発見
- TRUSTはPubTabNetで97.1%のStructure TEDSと96.2%のTEDsを達成し、従来の最先端手法を大きく上回った。
- クエリベースのスプリッティングモジュールは、長距離文脈モデリングの優位性により、SPLERGEスプリットモデルと比較してStructure TEDSで2.3%、TEDsで2.8%の性能向上を達成した。
- 頂点ベースのマージングモジュールをヒューリスティックな後処理に置き換えると、Structure TEDSが88.3%、TEDsが85.4%に低下し、その重要性が裏付けられた。
- マージングモジュールにおけるクロス特徴強化を除去すると、Structure TEDSは97.1%から90.6%に低下し、性能向上に寄与する重要性が明確になった。
- TRUSTはPubTabNetで10 FPSで動作し、SEM(1.94 FPS)やEDD(1 FPS)を上回り、現在までで最も高速なテーブル構造認識手法となった。
- SynthTableデータセットでは、最も困難なカテゴリ(C4:回転および透視変換を施されたテーブル)で92.4%のTEDsを達成し、EDDやSPLERGEを大きく上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。