Skip to main content
QUICK REVIEW

[論文レビュー] Gaussian Constrained Attention Network for Scene Text Recognition

Zhi Qiao, Xugong Qin|arXiv (Cornell University)|Oct 19, 2020
Handwritten Text Recognition Techniques参考文献 63被引用数 7
ひとこと要約

本稿では、ガウス制約リファインメントモジュール(GCRM)を導入して注意重みを明示的に精錬する2次元アテンションベースの手法、ガウス制約アテンションネットワーク(GCAN)を提案する。これにより、注意の拡散を低減し、局所化精度を向上させる。GCANは、最小限の推論オーバーヘッドで、複数のシーンテキスト認識ベンチマークで最先端の性能を達成する。

ABSTRACT

Scene text recognition has been a hot topic in computer vision. Recent methods adopt the attention mechanism for sequence prediction which achieve convincing results. However, we argue that the existing attention mechanism faces the problem of attention diffusion, in which the model may not focus on a certain character area. In this paper, we propose Gaussian Constrained Attention Network to deal with this problem. It is a 2D attention-based method integrated with a novel Gaussian Constrained Refinement Module, which predicts an additional Gaussian mask to refine the attention weights. Different from adopting an additional supervision on the attention weights simply, our proposed method introduces an explicit refinement. In this way, the attention weights will be more concentrated and the attention-based recognition network achieves better performance. The proposed Gaussian Constrained Refinement Module is flexible and can be applied to existing attention-based methods directly. The experiments on several benchmark datasets demonstrate the effectiveness of our proposed method. Our code has been available at https://github.com/Pay20Y/GCAN.

研究の動機と目的

  • アテンションの拡散問題に対処すること。これは、アテンション重みが広がり、デコードにノイズをもたらすためである。
  • 間接的监督に依存せず、学習可能なガウスマスクを用いて直接的に生のアテンションマップを精錬することで、アテンションの局所化を向上させること。
  • 既存の2次元アテンションベースの認識フレームワークに簡単に統合可能な柔軟なモジュールを設計すること。
  • 長文シーケンスにおける性能を向上させることで、アテンションの集中度と整合性を高めること。

提案手法

  • ガウス制約リファインメントモジュール(GCRM)は、RNNの隠れ状態とグレップフィーチャーからガウスパラメータ(平均と分散)を予測し、ガウスマスクを生成する。
  • 生のアテンションマップは、予測されたガウスマスクとの要素ごとの積算により精錬され、より集中したアテンション重みが得られる。
  • 精錬されたアテンション重みを用いて、より正確なグレップが生成され、元のグレップと融合されて文字予測に用いられる。
  • GCRMはプラグアンドプレイであり、SARなど既存の2次元アテンションベースのモデルに、アーキテクチャの変更なしに統合可能である。
  • 標準的な交差エントロピー損失を用いたエンドツーエンド学習が行われ、標準的な認識ラベル以外の追加の監督は不要である。
  • パrameter推定とのアブレーションスタディにより、学習されたパラメータが最尤推定を上回ることが示された。

実験結果

リサーチクエスチョン

  • RQ1学習可能なガウスマスクによる注意重みの明示的精錬は、シーンテキスト認識における注意の拡散を低減するか?
  • RQ2提案されたGCRMは、推論コストを著しく増加させることなく認識精度を向上させることができるか?
  • RQ3追加の監督を用いたアテンション重みの精錬と比較して、GCRMは性能向上とロバスト性の面で優れているか?
  • RQ4アテンション機構が通常劣化する長文シーケンスにおいて、本手法は性能を維持または向上させることができるか?

主な発見

  • GCANにGCRMを適用した場合、IIIT5Kでは94.4%の精度を達成し、ベースラインのSARよりも1.4%絶対的に向上し、アテンション監督付きSARよりも1.3%向上した。
  • SVTでは90.1%の精度を達成し、ベースラインのSARよりも3.4%向上し、アテンション監督付きSARよりも2.8%向上した。
  • SVTPでは81.2%の精度を達成し、ベースラインよりも2.1%向上し、監視付きSARよりも2.4%向上した。
  • 長文シーケンスにおいて優れたロバスト性を示した:ラベル長が延長するにつれて誤差率の上昇が、ベースラインおよび監視付きSARよりも遅やかに推移した。
  • 最尤推定によるパrameter推定よりもGCRMが優れた性能を示し、学習されたガウスマスクが推定されたものよりも効果的であることが示された。
  • 速度コストは最小限に抑えられた:訓練時で平均7.6ms、推論時で平均8.9msの追加時間を要し、実世界の展開に実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。