Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Document Image Classification Using Region-Based Graph Neural Network

Jaya Krishna Mandivarapu, Eric Bunch|arXiv (Cornell University)|Jun 25, 2021
Handwritten Text Recognition Techniques参考文献 23被引用数 5
ひとこと要約

本稿では、PubLayNetを用いて抽出された意味的領域から視覚的・テキスト的・レイアウト特徴を統合する、領域ベースのグラフニューラルネットワーク(Eff-GNN)を用いた効率的なドキュメント画像分類フレームワークを提案する。この手法は、顕著に小型化されたモデルサイズと短い学習・推論時間で、準SOTAの分類精度を達成しており、CPU上でのコスト効率の高いデプロイとスケーラブルなエンタープライズ利用を可能にする。

ABSTRACT

Document image classification remains a popular research area because it can be commercialized in many enterprise applications across different industries. Recent advancements in large pre-trained computer vision and language models and graph neural networks has lent document image classification many tools. However using large pre-trained models usually requires substantial computing resources which could defeat the cost-saving advantages of automatic document image classification. In the paper we propose an efficient document image classification framework that uses graph convolution neural networks and incorporates textual, visual and layout information of the document. We have rigorously benchmarked our proposed algorithm against several state-of-art vision and language models on both publicly available dataset and a real-life insurance document classification dataset. Empirical results on both publicly available and real-world data show that our methods achieve near SOTA performance yet require much less computing resources and time for model training and inference. This results in solutions than offer better cost advantages, especially in scalable deployment for enterprise applications. The results showed that our algorithm can achieve classification performance quite close to SOTA. We also provide comprehensive comparisons of computing resources, model sizes, train and inference time between our proposed methods and baselines. In addition we delineate the cost per image using our method and other baselines.

研究の動機と目的

  • 大規模なエンタープライズデプロイに適した低リソースで高パフォーマンスなドキュメント画像分類フレームワークの開発。
  • 大規模な事前学習済みビジョンモデルや言語モデルに依存せずに、グラフニューラルネットワークを用いて視覚的・テキスト的・レイアウト特徴を効果的に統合すること。
  • 最先端モデルの間で、学習時間、GPUメモリ使用量、推論速度といった計算効率を体系的に評価・比較すること。
  • 保険請求処理などの実世界の応用分野における、スケーラブルでコスト効率の良いドキュメント分類モデルのデプロイを可能にすること。
  • 競争力ある分類精度を維持したまま、高価なGPUリソースへの依存を低減すること。

提案手法

  • インスタンスセグメンテーションにより、事前学習済みのPubLayNetモデルを用いてドキュメント画像から意味的領域を抽出する。
  • テキスト特徴はWord2Vec埋め込みにより抽出され、画像特徴は事前学習済みのVGG-16モデルを用いて抽出される。
  • 各ノードが意味的領域を表すグラフを構築し、ノード特徴は視覚的・テキスト的・位置的レイアウト埋め込みを組み合わせて構成される。
  • ソートプーリングを備えたグラフ畳み込みネットワーク(GCN)を用い、任意のグラフ構造に対してエンドツーエンドの学習が可能になるように、ドキュメント全体の分類を実行する。
  • 交差エントロピー損失を用いて学習を行い、精度と計算効率の両面で最適化される。
  • モデルはCPU上で推論可能であり、AWS FargateおよびECS経由でのデプロイを可能にするDockerコンテナにモデル重みがパckagedされている。

実験結果

リサーチクエスチョン

  • RQ1グラフニューラルネットワークは、ドキュメント画像からの視覚的・テキスト的・レイアウト特徴を効果的に統合し、競争力ある分類精度を達成できるか?
  • RQ2本手法は、SOTAのビジョンモデルや言語モデルと比較して、計算効率およびリソース使用量において優れているか?
  • RQ3本モデルは、最小限のハードウェア要件でCPU上でデプロイ可能でありながら、高い精度を達成できるか?
  • RQ4OCRが失敗または不完全な場合に、テキスト特徴と画像特徴を組み合わせることによる性能への影響は何か?
  • RQ5実世界および公開データセットにおいて、学習時間、メモリ使用量、推論速度の観点から、本モデルはどのようにスケーリングするか?

主な発見

  • 保険データセット(11クラス)では、Eff-GNNがWord2Vecと画像特徴を用いて91.0%のAUCを達成し、BERT(91.95%)と同等の性能を示したが、パラメータ数は110M対734kにまで削減された。
  • Tobacco-3482データセット(10クラス)では、Eff-GNNが画像およびテキスト特徴を用いて77.5%のAUCを達成し、効率性においてBERT(79.0%)とVGG-16(81.5%)を上回った。
  • GPU上で学習したEff-GNNは50エポックで3.5分で完了したが、BERTは6.2時間を要し、GPUメモリ使用量は470MB対10.5GBであった。
  • Eff-GNNの推論時間はGPUおよびCPUで1画像あたり0.79秒であり、BERTの40秒に比べて顕著に高速で、CPU上ではGPUメモリ使用量がゼロであった。
  • モデルサイズは734kパラメータ(124k + 610k)にまで削減され、CPUデプロイとスケーラブルなコンテナホスティングが可能になった。
  • フレームワークはBERT比で推論速度が40倍速くなり、GPUメモリ使用量が10倍削減されたことから、エンタープライズデプロイにおいて顕著なコスト優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。