Skip to main content
QUICK REVIEW

[論文レビュー] Decoupled Attention Network for Text Recognition

Tianwei Wang, Yuanzhi Zhu|arXiv (Cornell University)|Dec 21, 2019
Handwritten Text Recognition Techniques参考文献 45被引用数 8
ひとこと要約

本稿では、テキスト認識のための分離型アテンションネットワーク(DAN)を提案する。DANは、履歴的なデコード結果からのアライメント操作を分離し、視覚的特徴にのみ依存する畳み込み型アライメントモジュール(CAM)を用いる。再帰的処理からのアライメントの分離により、DANは誤りの蓄積を低減し、手書き文字および不規則なシーンテキストを含む複数のテキスト認識ベンチマークで最先端の性能を達成するとともに、テキスト長や画像の不具合に対して優れた耐性を示す。

ABSTRACT

Text recognition has attracted considerable research interests because of its various applications. The cutting-edge text recognition methods are based on attention mechanisms. However, most of attention methods usually suffer from serious alignment problem due to its recurrency alignment operation, where the alignment relies on historical decoding results. To remedy this issue, we propose a decoupled attention network (DAN), which decouples the alignment operation from using historical decoding results. DAN is an effective, flexible and robust end-to-end text recognizer, which consists of three components: 1) a feature encoder that extracts visual features from the input image; 2) a convolutional alignment module that performs the alignment operation based on visual features from the encoder; and 3) a decoupled text decoder that makes final prediction by jointly using the feature map and attention maps. Experimental results show that DAN achieves state-of-the-art performance on multiple text recognition tasks, including offline handwritten text recognition and regular/irregular scene text recognition.

研究の動機と目的

  • 再帰的デコードによる誤り伝播によって引き起こされるアテンションベースのテキスト認識におけるアライメントの不整合問題に対処すること。
  • アテンション機構における履歴的デコード状態への依存度を低げ、アライメントの安定性を向上させること。
  • 多様なテキストタイプにわたって高い性能を維持する柔軟なエンドツーエンドのテキスト認識フレームワークを開発すること。
  • 現実世界のテキスト認識で一般的な長時間系列および微細な画像不具合に対して耐性を高めること。
  • IIIT-5K、IC13、IC03、SVT-P、CUTE80を含む標準ベンチマークで最先端の結果を達成すること。

提案手法

  • 畳み込み型アライメントモジュール(CAM)を提案する。このCAMは、CNNエンコーダーからの視覚的特徴にのみ依存してアテンションマップを計算し、隠れ状態や以前のトークン埋め込みに依存しない。
  • デコーダーをCAMによるアライメントと、特徴マップとアテンションマップの両方に同時に注目する別個のGRUベースのテキストデコーダーに分離する。
  • マルチスケールの視覚的特徴から空間的に密集したアテンションマップを生成するために、チャネル単位で畳み込みニューラルネットワーク(FCN)を用いる。
  • 最終的な文字予測に、視覚的特徴とアテンション特徴の両方を活用する双方向GRUデコーダーを実装する。
  • 初期学習率を1.0として固定し、3エポック目以降に0.1に低下させるADADELTAを用いて、エンドツーエンドでモデルを学習する。
  • 規則的および不規則なテキストレイアウトに柔軟に適応できるよう、DAN-1DおよびDAN-2Dの1Dおよび2Dバージョンをサポートする。

実験結果

リサーチクエスチョン

  • RQ1再帰的デコードからのアライメント操作の分離は、アテンションベースのテキスト認識性能の向上に寄与するか?
  • RQ2アライメントに視覚的特徴のみを用いることで、長時間または複雑なテキスト系列における誤り蓄積と不整合が低減するか?
  • RQ3提案されたDANモデルは、規則的および不規則なシーンテキスト認識ベンチマークで最先端の手法と比較してどのように性能を発揮するか?
  • RQ4パディング、伸縮、バウンディングボックスの拡大などの画像不具合に対して、DANはどの程度耐性を示すか?
  • RQ5分離型アーキテクチャは、手書き文字や曲がったテキストを含む多様なテキストタイプにおいても高い性能を維持できるか?

主な発見

  • DANは、規則的なシーンテキスト認識においてIIIT-5KおよびIC03で最先端の性能を達成し、SVTおよびIC13でも現在のSOTAと同等の性能を示す。
  • DAN-2Dは、SVT-PerspectiveおよびCUTE80で最先端の結果を達成し、不規則なテキストに対する既存の2Dベース手法を上回る。
  • DANは画像不具合に対して優れた耐性を示す。IIIT-p、IIIT-r-p、IC13-ex、IC13-r-exといったIIIT-5KおよびIC13の変種に対して、CA-FCNを一貫して上回る。
  • 特に手書きテキスト認識において、アライメントからの誤り伝播が低減されているため、長時間系列認識において顕著な利点を示す。
  • アブレーションスタディの結果、CAMが視覚的特徴にのみ依存することで、アライメントの安定性が向上し、デコード誤りへの感受性が低下することが確認された。
  • モデルの柔軟性により、1Dおよび2Dバージョンの間でスムーズに切り替えが可能であり、アーキテクチャの大規模な見直しを伴わずに異なるテキストレイアウトに適応可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。