Skip to main content
QUICK REVIEW

[論文レビュー] Double Supervised Network with Attention Mechanism for Scene Text Recognition

Yuting Gao, Zheng Huang|arXiv (Cornell University)|Aug 2, 2018
Handwritten Text Recognition Techniques参考文献 29被引用数 8
ひとこと要約

本稿では、文脈レベルのモデリングと文字レベルの意味的強化の2つの監視ブランチを統合した、語彙フリーなシーンテキスト認識を目的とした二重監視型エンドツーエンドのディーブラーニングフレームワークDSANを提案する。テキストアテンションモジュールを組み合わせることで、明示的および暗黙的な意味的情報をマルチタスク学習により共同最適化し、IIIT5K、ICDAR2013、SVTベンチマークでそれぞれ88.6%、92.3%、84.1%の最先端の精度を達成した。

ABSTRACT

In this paper, we propose Double Supervised Network with Attention Mechanism (DSAN), a novel end-to-end trainable framework for scene text recognition. It incorporates one text attention module during feature extraction which enforces the model to focus on text regions and the whole framework is supervised by two branches. One supervision branch comes from context-level modelling and another comes from one extra supervision enhancement branch which aims at tackling inexplicit semantic information at character level. These two supervisions can benefit each other and yield better performance. The proposed approach can recognize text in arbitrary length and does not need any predefined lexicon. Our method outperforms the current state-of-the-art methods on three text recognition benchmarks: IIIT5K, ICDAR2013 and SVT reaching accuracy 88.6%, 92.3% and 84.1% respectively which suggests the effectiveness of the proposed method.

研究の動機と目的

  • テキストに明示的な意味的文脈が欠如している自然で制約のない環境におけるシーンテキスト認識の課題に対処すること。
  • 事前定義された語彙に依存せずに、任意長のテキストシーケンスの認識性能を向上させること。
  • アテンションとマルチ監視を用いて、低品質、ごみだらけ、劣化したテキスト画像に対してもモデルのロバスト性を向上させること。
  • シーンテキストにおいて、明示的な文脈的関係と暗黙の文字レベルの意味的要因を同時にモデリングすること。

提案手法

  • 1/8解像度の特徴マップを生成するように、ストライドを変更したResNet-34ベースのバックボーンを使用し、その後に3x1畳み込みとシグモイド活性化関数を用いたテキストアテンションモジュールを適用して空間的アテンションマスクを生成する。
  • アテンションマスクを特徴マップにブロードキャスト乗算することで、アテンション重み付き特徴を生成し、不要な領域を抑制するとともに、テキスト関連の特徴を強化する。
  • アテンション強化特徴は、順方向および逆方向のLSTMを2層用いた順序依存性を捉える文脈レベルモデリングブランチと、並列して処理される。
  • 追加の監視強化ブランチは、文字レベルの分類器を用いて、文字レベルでの暗黙の意味的情報をモデリングし、第二の監視信号を提供する。
  • 2つのブランチは、ハイパーパrameter λ が文脈レベルと文字レベルの監視のバランスを制御するマルチタスク損失関数により共同学習される。
  • 推論時には、トランスクリプション出力は文脈レベルモデリングブランチから得られるが、文字レベルブランチは訓練中に堅牢な表現の学習を支援する。

実験結果

リサーチクエスチョン

  • RQ1明示的な文脈的関係と暗黙の文字レベルの意味的要因を同時にモデリングする二重監視メカニズムは、シーンテキスト認識性能を向上させ得るか?
  • RQ2テキスト領域を強調する学習可能なアテンションモジュールを統合することで、低品質な困難なシーン画像における認識精度が向上するか?
  • RQ3監視強化ブランチは、強い文脈的ヒントのないテキストシーケンスにおいて、どの程度性能を向上させるか?
  • RQ4文脈レベルと文字レベルの監視の共同学習は、多様なベンチマークにわたる一般化性能にどのように影響するか?

主な発見

  • DSANはIIIT5Kベンチマークで88.6%の最先端の精度を達成し、従来手法を大きく上回った。
  • ICDAR2013では92.3%の精度に達し、前回のSOTAより1.5ポイント向上した。
  • SVTデータセットでは84.1%の精度を達成し、監視強化ブランチを搭載しないベースラインから8.4ポイントの改善を示した。
  • アブレーションスタディの結果、監視強化ブランチはIIIT5Kで5.0%、ICDAR2013で3.1%、SVTで6.7%の精度向上を示した。
  • テキストアテンションモジュールはSVTで1.7%の精度向上をもたらし、背景のゴミを効果的に抑制し、テキスト特徴を強化する有効性を示した。
  • 変動するフォント、ぼやけ、不均一な照明条件を含む多様なシーンテキスト状況においても、モデルは良好な一般化性能を示した。定性的な例からもその有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。