Skip to main content
QUICK REVIEW

[論文レビュー] PGNet: Real-time Arbitrarily-Shaped Text Spotting with Point Gathering Network

Pengfei Wang, Chengquan Zhang|arXiv (Cornell University)|Apr 12, 2021
Handwritten Text Recognition Techniques被引用数 5
ひとこと要約

PGNetは、文字レベルのアノテーション、NMS、RoI操作を不要とする、任意形状のテキスト向けのリアルタイムでワンショットのテキストスポッティングフレームワークを提案する。Point Gathering CTC(PG-CTC)損失とデコーダーを導入することで実現した。Total-Textで46.7 FPSを達成し、競争力ある精度を発揮する。グラフリファインメントモジュール(GRM)により、文字列の文脈的モデリングが向上し、認識性能が向上する。

ABSTRACT

The reading of arbitrarily-shaped text has received increasing research attention. However, existing text spotters are mostly built on two-stage frameworks or character-based methods, which suffer from either Non-Maximum Suppression (NMS), Region-of-Interest (RoI) operations, or character-level annotations. In this paper, to address the above problems, we propose a novel fully convolutional Point Gathering Network (PGNet) for reading arbitrarily-shaped text in real-time. The PGNet is a single-shot text spotter, where the pixel-level character classification map is learned with proposed PG-CTC loss avoiding the usage of character-level annotations. With a PG-CTC decoder, we gather high-level character classification vectors from two-dimensional space and decode them into text symbols without NMS and RoI operations involved, which guarantees high efficiency. Additionally, reasoning the relations between each character and its neighbors, a graph refinement module (GRM) is proposed to optimize the coarse recognition and improve the end-to-end performance. Experiments prove that the proposed method achieves competitive accuracy, meanwhile significantly improving the running speed. In particular, in Total-Text, it runs at 46.7 FPS, surpassing the previous spotters with a large margin.

研究の動機と目的

  • 任意形状のテキストを処理できるリアルタイムでエンドツーエンドのテキストスポッティングシステムを構築すること。
  • ワンショットで完全に畳み込みニューラルネットワーク(FCN)アーキテクチャを設計することで、NMS や RoI 操作のような計算コストの高い処理を排除すること。
  • 非伝統的な読み順序や複雑なテキストレイアウトにおいて、認識のロバスト性を向上させること。
  • グラフリファインメントモジュール(GRM)を用いて文字列の文脈的モデリングを実現し、認識精度を向上させること。
  • パブリックベンチマークで認識性能を損なわずに、高い推論速度を達成すること。

提案手法

  • マルチタスク学習の枠組みで、テキスト中心線(TCL)、境界オフセット(TBO)、方向オフセット(TDO)、文字分類マップ(TCC)を予測する完全畳み込みネットワーク(FCN)を用いる。
  • PG-CTC損失により、文字レベルのアノテーションが不要な状態で、ピクセルレベルの文字分類マップのエンドツーエンド学習が可能になる。
  • PG-CTCデコーダーは、TCL と TDO によって定義される読み順に従って、2次元の TCC マップを文字確率のシーケンスに逐次化する。
  • TDO マップを用いることで、読み順が左から右へまたは上から下へでないテキストの正しく認識が可能になる。
  • グラフリファインメントモジュール(GRM)は、空間的グラフニューラルネットワークを用いて、隣接する文字からの視覚的および意味的文脈を活用し、予測を精緻化する。
  • GRMは、文字点間のL2距離に基づいた対称正規化ラプラシアン隣接行列を用いて、ノード間の関係を定義する。

実験結果

リサーチクエスチョン

  • RQ1ワンショットでエンドツーエンドのテキストスポッターが、文字レベルのアノテーションを必要とせずに高い精度を維持できるか?
  • RQ2新規の損失関数とデコーディング機構(PG-CTC)が、NMS や RoI 操作を置き換えても性能が低下しないか?
  • RQ3TDO を用いた動的読み順回復が、非伝統的配置のテキスト認識を改善できるか?
  • RQ4グラフベースのリファインメントモジュールが、文字間の文脈的関係をモデル化することで認識精度を向上できるか?
  • RQ5提案手法が、任意形状のテキストベンチマークで最先端の精度を維持しながら、リアルタイムの推論速度を達成できるか?

主な発見

  • PGNetはTotal-Textベンチマークで46.7 FPSを達成し、以前の最先端手法と比べて顕著に推論速度が向上した。
  • Total-TextおよびICDAR2015で競争力ある認識精度を達成し、曲がった・不規則なテキストへの汎化性能が優れていることが示された。
  • PG-CTC損失により、文字レベルのアノテーションが不要となり、データアノテーションコストが削減されながらも性能を維持した。
  • TDO マップにより、非伝統的読み順のテキストも正しく認識可能であることが確認された。定性的な結果では、「MOVE」が「EVOM」ではなく正しく認識された。
  • GRMにより、欠落・誤認識・余分な文字の修正が可能となり、例として「PRT」→「PORT」や「NARKET」→「MARKET」の修正が確認された。
  • 定性的な結果から、GRMが予測を精緻化するために文字の追加・変更・削除を効果的に行っていることが確認され、エンドツーエンド認識における有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。