Skip to main content
QUICK REVIEW

[論文レビュー] Primitive Representation Learning for Scene Text Recognition

Ruijie Yan, Liangrui Peng|arXiv (Cornell University)|May 10, 2021
Handwritten Text Recognition Techniques参考文献 49被引用数 5
ひとこと要約

本稿では、シーンテキスト認識のためのプリミティブ表現学習ネットワーク(PREN)およびPREN2Dを提案する。特徴マップを非有向グラフとしてモデル化し、プーリングと重み付きアグリゲーターを用いて安定的で内因的なプリミティブ表現を学習した後、グラフ畳み込みネットワークを用いて視覚的テキスト表現に変換する。この手法は、英語および中国語のシーンテキストベンチマークで最先端の性能を達成しており、PREN2Dは従来のアテンションベースのモデルを上回り、不一致を低減し、精度を向上させた。

ABSTRACT

Scene text recognition is a challenging task due to diverse variations of text instances in natural scene images. Conventional methods based on CNN-RNN-CTC or encoder-decoder with attention mechanism may not fully investigate stable and efficient feature representations for multi-oriented scene texts. In this paper, we propose a primitive representation learning method that aims to exploit intrinsic representations of scene text images. We model elements in feature maps as the nodes of an undirected graph. A pooling aggregator and a weighted aggregator are proposed to learn primitive representations, which are transformed into high-level visual text representations by graph convolutional networks. A Primitive REpresentation learning Network (PREN) is constructed to use the visual text representations for parallel decoding. Furthermore, by integrating visual text representations into an encoder-decoder model with the 2D attention mechanism, we propose a framework called PREN2D to alleviate the misalignment problem in attention-based methods. Experimental results on both English and Chinese scene text recognition tasks demonstrate that PREN keeps a balance between accuracy and efficiency, while PREN2D achieves state-of-the-art performance.

研究の動機と目的

  • CTCベースおよびアテンションベースのシーンテキスト認識モデルの限界、特にCTCにおける冗長性とアテンション機構における不一致を解消すること。
  • 多方向および不規則なテキストインスタンスに対して強い、安定的で内因的な視覚的表現を、シーンテキスト画像から学習すること。
  • プリミティブ表現を用いた並列デコードを可能にするフレームワークを構築すると同時に、アテンションベースのモデルと互換性を保つこと。
  • 2Dアテンション機構における不一致問題を、視覚的特徴から純粋に導出された視覚的テキスト表現を統合することで軽減すること。

提案手法

  • 畳み込みニューラルネットワーク(CNN)の特徴マップ内の要素を非有向グラフのノードとしてモデル化し、グローバルな特徴アグリゲーションを可能にする。
  • 共通の畳み込みとグローバル平均プーリングを適用するプーリングアグリゲーターを提案し、多様なテキストインスタンス間で共通する構造的パターンを学習する。
  • サンプル固有のヒートマップを生成する重み付きアグリゲーターを設計し、特徴マップ内の顕著な領域に適応的に注目する。
  • 学習されたプリミティブ表現を高レベルの視覚的テキスト表現に変換するため、グラフ畳み込みネットワーク(GCNs)を用いる。
  • 視覚的テキスト表現を用いて並列デコードを実現するPRENを構築し、2Dアテンションベースのエンコーダーデコーダー枠組みに統合してPREN2Dを構築し、アライメントを改善する。
  • 合成データで6エポック学習し、実データで20エポック微調整する。水平および垂直方向のテキストサブセットからのランダムサンプリングを用いたデータオーグメンテーションを実施する。

実験結果

リサーチクエスチョン

  • RQ1グローバル特徴アグリゲーションから導出されるプリミティブ表現は、多方向および不規則なテキスト画像におけるシーンテキスト認識のロバスト性を向上させるか?
  • RQ2視覚的特徴から純粋に学習された視覚的テキスト表現の使用は、アテンションベースのシーンテキスト認識における不一致問題を軽減するか?
  • RQ3提案されたプリミティブ表現学習フレームワークは、既存のアテンションベースのモデルに効果的に統合可能で、性能を向上させられるか?
  • RQ4提案手法は、英語および中国語のシーンテキスト認識ベンチマークにおいて、最先端のモデルと比較してどのように性能を発揮するか?

主な発見

  • PREN2Dは、多方向の中国語RCTWデータセットで85.0%の最高単語正答率を達成し、Baseline2D(84.5%)およびCNN-LSTM-CTC(59.1%)を上回った。
  • 英語のIIIT5k、SVT、IC03、IC13、IC15、SVTP、CUTEデータセットにおいて、PREN2Dはすべての比較モデルの中で最高の性能を示し、多様なベンチマークにわたる優れた一般化能力を示した。
  • プーリングアグリゲーターは、同じプリミティブ表現に対して異なるテキストインスタンス間で一貫した特徴マップ応答を示し、共通する構造的パターンを学習していることが確認された。
  • 重み付きアグリゲーターは、文字の境界や中心に注目する適応的ヒートマップを生成しており、プーリングアグリゲーターに比べて顕著な特徴の局在化が優れていることが示された。
  • アテンションマップの可視化結果から、PREN2DはBaseline2Dよりも正確なアライメントを生成しており、'N'の中央部を正しく対応づけている一方で、Baseline2Dは'N'の右側を'I'と誤って関連付けていることがわかった。
  • PRENは中国語データセットで平均76.5%の単語正答率を達成し、CNN-LSTM-CTC(59.1%)を著しく上回り、複雑な文字セットの処理においてプリミティブ表現学習の有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。