Skip to main content
QUICK REVIEW

[論文レビュー] Bidirectional Scene Text Recognition with a Single Decoder

Maurits Bleeker, Maarten de Rijke|arXiv (Cornell University)|Dec 8, 2019
Handwritten Text Recognition Techniques参考文献 43被引用数 8
ひとこと要約

この論文は、入力レベルでの方向埋め込みを用いてデコード方向を条件づける、単一のデコーダーを持つTransformerベースのアーキテクチャであるBi-STETを提案する。これにより、二重デコーダー手法と比較して50%少ない学習イテレーションと少ないモデルパラメータで最先端の性能を達成する。

ABSTRACT

Scene Text Recognition (STR) is the problem of recognizing the correct word or character sequence in a cropped word image. To obtain more robust output sequences, the notion of bidirectional STR has been introduced. So far, bidirectional STRs have been implemented by using two separate decoders; one for left-to-right decoding and one for right-to-left. Having two separate decoders for almost the same task with the same output space is undesirable from a computational and optimization point of view. We introduce the bidirectional Scene Text Transformer (Bi-STET), a novel bidirectional STR method with a single decoder for bidirectional text decoding. With its single decoder, Bi-STET outperforms methods that apply bidirectional decoding by using two separate decoders while also being more efficient than those methods, Furthermore, we achieve or beat state-of-the-art (SOTA) methods on all STR benchmarks with Bi-STET. Finally, we provide analyses and insights into the performance of Bi-STET.

研究の動機と目的

  • 左から右および右から左のデコードにそれぞれ別々のデコーダーを用いる従来の双方向シーンテキスト認識(STR)手法の非効率性と冗長性を解消すること。
  • アーキテクチャやアルゴリズムのレベルではなく、入力レベルでのタスク条件付けを実装することで、双方向STRのためのより効率的で統合されたアーキテクチャを検討すること。
  • モデルの効率性を向上させるとともにパラメータ共有を促進しながら、標準的なSTRベンチマークで最先端の性能を維持または上回ること。
  • 1つのTransformerデコーダーが、特定の注意ヘッドを別々に設けることなく、双方向デコードを効果的に学習・活用できるかどうかを調査すること。

提案手法

  • デコード方向(左から右または右から左)を条件づけるために、入力系列に方向埋め込みを追加する単一デコーダーのTransformerアーキテクチャ(Bi-STET)を導入する。
  • Transformerの自己注意機構を活用して、再帰的でない形で系列を処理し、グローバルな文脈モデリングを可能にするとともに、特定のデコード順序に偏った帰納的バイアスを排除する。
  • 入力埋め込みに学習可能な方向トークン(例:'L2R' または 'R2L')を組み込むことで、モデルをデコード方向に条件づけ、1つのデコーダーが両方向に対応可能にする。
  • すべてのモデルパラメータ(注目ヘッドを含む)をデコード方向間で共有することで、パラメータ効率性とマルチタスク学習を促進する。
  • 画像特徴量と予測文字との間のアライメントを実現するため、標準的なTransformerエンコーダ-デコーダー構造を採用し、クロスアテンションを用いる。
  • 統合されたモデルを両方のデコード方向を同時に最適化する形でエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1二重デコーダーではなく、1つの共有デコーダーを用いることで、双方向シーンテキスト認識を効果的に実現できるか?
  • RQ2方向埋め込みによる入力レベルのタスク条件付けが、単一のTransformerデコーダーが二重デコーダー構造を上回る正確性と効率性を達成できるか?
  • RQ3単一デコーダー手法は、曲がった、回転させた、透視歪みを受けるテキストに対してもどの程度一般化できるか?
  • RQ4Transformerモデルの注目ヘッドは、特定のデコード方向に特化しているのか、それとも両方向で共有された表現を学習しているのか?
  • RQ5RNNベースおよび二重デコーダーのTransformerベースラインと比較して、長系列認識においてこのモデルはどの程度の性能を示すか?

主な発見

  • Bi-STETは、IIIT-5K、ICDAR2013、CUTE80を含むすべての標準ベンチマークで、最先端のSTR手法と同等またはそれを上回る性能を達成する。
  • 二重デコーダー手法と比較して、50%少ない学習イテレーションと顕著に少ないモデルパラメータで最先端の性能を達成する。
  • 曲がったおよび透視歪みを受けるテキストに対しても頑健である。たとえば、'ballys' や 'chathamkent' といった単語で、強い歪み下でも正しく認識できる。
  • 長系列(最大17文字)に対しても高い正確性を維持し、11文字を超える長さのシーケンスでは、従来の二重デコーダー手法を上回る性能を示す。
  • 注目ヘッドは特定のデコード方向に特化しておらず、左から右および右から左の両方のデコードで効果的に共有・利用されている。
  • 明示的な補正モジュールを必要とせず、回転やずれのあるテキスト変形に対しても良好に一般化する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。