Skip to main content
QUICK REVIEW

[論文レビュー] Global Table Extractor (GTE): A Framework for Joint Table Identification and Cell Structure Recognition Using Visual Context

Xinyi Zheng, Doug Burdick|arXiv (Cornell University)|May 1, 2020
Handwritten Text Recognition Techniques参考文献 42被引用数 12
ひとこと要約

本稿では、視覚的文脈を活用してテーブルとセル構造を同時に検出する、ビジョンガイドドフレームワークであるGlobal Table Extractor (GTE)を提案する。従来のオブジェクト検出モデルに、テーブル単位の包含制約を強制することで改善され、階層的なセル検出を活用している。GTEはICDAR 2013および2019で最先端の性能を達成しており、RetinaNetと比較してFinTabNetにおけるセル構造認識で45%以上の向上を達成した。

ABSTRACT

Documents are often used for knowledge sharing and preservation in business and science, within which are tables that capture most of the critical data. Unfortunately, most documents are stored and distributed as PDF or scanned images, which fail to preserve logical table structure. Recent vision-based deep learning approaches have been proposed to address this gap, but most still cannot achieve state-of-the-art results. We present Global Table Extractor (GTE), a vision-guided systematic framework for joint table detection and cell structured recognition, which could be built on top of any object detection model. With GTE-Table, we invent a new penalty based on the natural cell containment constraint of tables to train our table network aided by cell location predictions. GTE-Cell is a new hierarchical cell detection network that leverages table styles. Further, we design a method to automatically label table and cell structure in existing documents to cheaply create a large corpus of training and test data. We use this to enhance PubTabNet with cell labels and create FinTabNet, real-world and complex scientific and financial datasets with detailed table structure annotations to help train and test structure recognition. Our framework surpasses previous state-of-the-art results on the ICDAR 2013 and ICDAR 2019 table competition in both table detection and cell structure recognition with a significant 5.8% improvement in the full table extraction system. Further experiments demonstrate a greater than 45% improvement in cell structure recognition when compared to a vanilla RetinaNet object detection model in our new out-of-domain FinTabNet.

研究の動機と目的

  • PDFやスキャン画像にネイティブな構造的エンコードがない中で、論理的なテーブル構造を再構築する課題に対処すること。
  • 視覚的文脈とグローバルなテーブルスタイルの手がかりを活用することで、テーブル検出とセル構造認識を向上させること。
  • テーブル構造認識モデルの学習と評価に適した、詳細なセルレベルのアノテーションを備えた大規模かつ高品質なデータセットを構築すること。
  • 既存のオブジェクト検出器やOCRパイプラインと統合可能なモジュラーや適応性の高いフレームワークを開発すること。
  • 多様なドキュメントタイプにわたり、テーブル検出およびセル構造認識の両面で、既存の最先端手法を上回ること。

提案手法

  • GTE-Tableは、自然な包含制約に基づく新しいペナルティ損失を導入する:セルはテーブル内に存在しなければならず、テーブルは複数のセルを含まなければならない。
  • GTE-Cellは、まずグローバルにテーブルスタイルを分類し、その後、異なるスタイルに特化した検出器を適用することで、セルの局所化を向上させる階層的検出ネットワークを採用する。
  • セルクラスターベースのアルゴリズムにより、検出されたバウンディングボックスを論理的な行と列にグループ化し、正確なセル構造再構築を可能にする。
  • マルチステージのトレーニングパイプラインを採用:まずテーブルスタイル分類器を学習し、次に同じスタイル分布からのデータを用いてテーブルおよびセル検出器をファインチューニングする。
  • 弱教師ありデータラベル付け法により、既存のドキュメント上でセルレベルのアノテーションを自動生成し、大規模な事前学習を可能にする。
  • 科学論文(PubTabNet)や財務報告書(FinTabNet)などのドメイン固有データに対してファインチューニングすることで、トランスファー学習をサポートする。

実験結果

リサーチクエスチョン

  • RQ1グローバルなテーブル包含制約を強制することで、統合的なテーブル検出とセル構造認識が向上するか?
  • RQ2テーブルスタイルに基づく階層的検出は、一般化されたオブジェクト検出器に比べて、より優れたセル局所化を達成するか?
  • RQ3弱教師ありラベル付け法により、複雑なテーブル構造のための十分な高品質なトレーニングデータを生成できるか?
  • RQ4スタイルがトレーニングデータと異なる財務報告書などのドメイン外データセットにおいて、このフレームワークの性能はいかがなものか?
  • RQ5提案されたフレームワークは、テーブル検出および構造認識の両面で、既存の最先端手法をどの程度上回るか?

主な発見

  • GTEはICDAR 2013のテーブル検出および構造認識ベンチマークで最先端の性能を達成し、以前の手法を上回った。
  • ICDAR 2019コンペティションでは、テーブルボーダー検出で重み付きF1が94を達成し、上位手法と同等の精度と再現率を示した。
  • FinTabNetにおけるセル構造認識では、GTEはファインチューニングなしでTEDSを41.57(ベースライン)から87.14に、ファインチューニングありでは91.02に向上させた。
  • GTEは、FinTabNetにおけるセル構造認識で、アンタッチドなRetinaNetベースラインに比べ45%以上の向上を示し、ドメイン外データへの一般化能力が優れていることを実証した。
  • セルレベルのアノテーションを追加した拡張版PubTabNetは、TEDSスコア93.01を達成し、元のスコア88.38を顕著に上回った。
  • フレームワークの性能は、アノテーションの曖昧さに対して頑健であり、複雑なテーブルにおける構造認識の評価において、IOU=0.9よりもIOU=0.1がより信頼性のある指標であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。