[論文レビュー] NRTR: A No-Recurrence Sequence-to-Sequence Model For Scene Text Recognition
NRTRは、エンコーダーとデコーダーの両方でRNNやCNNの代わりに自己注意機構を採用する、再帰的でないシーケンス・ツー・シーケンスのシーンテキスト認識モデルを提案する。これにより、高速な学習と競争力のある精度が実現される。完全な並列処理と2次元から1次元への特徴マッピングに特化した新規なモダリティ変換ブロックのおかげで、従来モデルと比較して少なくとも8倍高速な学習が可能となり、標準ベンチマークで最先端の性能を達成する。
Scene text recognition has attracted a great many researches due to its importance to various applications. Existing methods mainly adopt recurrence or convolution based networks. Though have obtained good performance, these methods still suffer from two limitations: slow training speed due to the internal recurrence of RNNs, and high complexity due to stacked convolutional layers for long-term feature extraction. This paper, for the first time, proposes a no-recurrence sequence-to-sequence text recognizer, named NRTR, that dispenses with recurrences and convolutions entirely. NRTR follows the encoder-decoder paradigm, where the encoder uses stacked self-attention to extract image features, and the decoder applies stacked self-attention to recognize texts based on encoder output. NRTR relies solely on self-attention mechanism thus could be trained with more parallelization and less complexity. Considering scene image has large variation in text and background, we further design a modality-transform block to effectively transform 2D input images to 1D sequences, combined with the encoder to extract more discriminative features. NRTR achieves state-of-the-art or highly competitive performance on both regular and irregular benchmarks, while requires only a small fraction of training time compared to the best model from the literature (at least 8 times faster).
研究の動機と目的
- 逐次計算によるRNNベースのシーンテキスト認識モデルの学習速度の遅さを解消すること。
- CNNベースのモデルの高コストな計算と長距離依存性の学習限界を克服すること。
- 再帰的でなく、畳み込みも使用しないシーケンス・ツー・シーケンスフレームワークを提案し、並列処理を向上させること。
- 2次元のシーン画像を1次元シーケンスに効果的に変換するためのモダリティ変換ブロックを設計すること。
- 通常および不規則なシーンテキストベンチマークの両方で、顕著に短縮された学習時間と最先端の認識精度を達成すること。
提案手法
- NRTRは、エンコーダーとデコーダーの両方でRNNやCNNの代わりにスタックされた自己注意機構を採用するエンコーダー・デコーダー構造を採用する。
- エンコーダーは、フラット化された画像パッチを多頭部自己注意機構で処理し、文脈を反映した特徴表現を生成する。
- デコーダーは、以前に生成されたトークンにのみ注目できるマスク付き自己注意機構を用いて、逐次的に文字シーケンスを生成する。
- 2次元入力画像を1次元シーケンスに変換するための新規なモダリティ変換ブロックを導入し、特徴の識別性を向上させる。
- 辞書や補正モジュールを一切使用せず、クロスエントロピー損失を用いてエンド・ツー・エンドで学習する。
- 自己注意機構により、すべての入力および出力位置間でグローバルな依存関係を同時にモデル化でき、RNNやCNNと比較して計算複雑度を低減する。
実験結果
リサーチクエスチョン
- RQ1RNNや畳み込みを一切使用せず、自己注意機構のみに依存するシーケンス・ツー・シーケンスのシーンテキスト認識モデルを構築可能か?
- RQ2自己注意機構を用いた特徴学習は、RNNやCNNと比較して、シーンテキスト認識における精度と学習速度の面で優れているか?
- RQ3モダリティ変換ブロックは、2次元画像入力と1次元シーケンスモデリングの間のギャップを効果的に埋め合わせることができるか?
- RQ4再帰的でないモデルは、不規則的で挑戦的なシーンテキスト画像に対しても頑健性を維持できるか?
- RQ5自己注意機構を用いたシーンテキスト認識において、モデルの複雑度、学習速度、認識精度のトレードオフはどのようなものか?
主な発見
- NRTRは、語彙や補正モジュールを使用しない状態でも、IIIT5Kで99.2%、SVTで98.4%、ICDAR2013で98.9%の最先端の認識精度を達成し、すべての通常のベンチマークで最先端の性能を示した。
- 不規則なベンチマークでは、SVT-Pで94.9%、ICDAR2015で86.6%、CUTE80で80.9%を達成し、語彙なし設定でも従来手法を上回った。
- NRTRは1台のTitan X GPUで1エポックあたり5.0時間で学習可能であり、これは、1エポックあたり41時間もかかった最良の先行モデル(Bai et al. [1])と比較して、少なくとも8倍高速である。
- 推論速度は1枚あたり約0.03秒であり、これはBai et al. [1]の0.11秒およびShi et al. [6]の0.2秒と比較して顕著に高速である。
- モダリティ変換ブロックは性能にとって不可欠であり、2次元から1次元への変換を効果的に行うことで、特徴表現の質とモデルの精度を向上させた。
- NRTRは、低解像度、曲がった、部分的遮断されたテキストなど、困難なケースに対しても優れた一般化性能を示した。失敗の主な原因は、重度の遮断や視覚的曖昧性に起因する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。