Skip to main content
QUICK REVIEW

[論文レビュー] TextScanner: Reading Characters in Order for Robust Scene Text Recognition

Zhaoyi Wan, Minghang He|arXiv (Cornell University)|Dec 28, 2019
Handwritten Text Recognition Techniques参考文献 34被引用数 12
ひとこと要約

TextScanner は、文字分類と幾何的局所化・順序予測を分離することで、耐障害性の高いシーンテキスト認識を実現する二重ブランチ型でセグメンテーションベースのフレームワークを提案する。分類と幾何(位置/順序)のための別々のブランチを用い、要素ごとの乗算による予測の統合により、正しい文字順序を保証するとともに、注目メカニズムのずれやセグメンテーションの閾値設定エラーを低減する。MLT-17 で 64.1% の正確性と 0.75 の正規化編集距離を達成し、先行する最先端手法を上回る性能を発揮した。

ABSTRACT

Driven by deep learning and the large volume of data, scene text recognition has evolved rapidly in recent years. Formerly, RNN-attention based methods have dominated this field, but suffer from the problem of extit{attention drift} in certain situations. Lately, semantic segmentation based algorithms have proven effective at recognizing text of different forms (horizontal, oriented and curved). However, these methods may produce spurious characters or miss genuine characters, as they rely heavily on a thresholding procedure operated on segmentation maps. To tackle these challenges, we propose in this paper an alternative approach, called TextScanner, for scene text recognition. TextScanner bears three characteristics: (1) Basically, it belongs to the semantic segmentation family, as it generates pixel-wise, multi-channel segmentation maps for character class, position and order; (2) Meanwhile, akin to RNN-attention based methods, it also adopts RNN for context modeling; (3) Moreover, it performs paralleled prediction for character position and class, and ensures that characters are transcripted in correct order. The experiments on standard benchmark datasets demonstrate that TextScanner outperforms the state-of-the-art methods. Moreover, TextScanner shows its superiority in recognizing more difficult text such Chinese transcripts and aligning with target characters.

研究の動機と目的

  • RNN-アテンションベースのシーンテキスト認識モデルにおける注目メカニズムのずれを解消すること。
  • 意味的セグメンテーションベースの手法におけるセグメンテーション閾値設定の問題を克服し、過剰・不足セグメンテーションを回避すること。
  • 特に曲がった、回転している、中国語テキストのような困難なテキストに対して認識の耐障害性を向上させること。
  • 推論時に明示的な順序監視を用いて、正しい文字順序を保証すること。
  • 分類ブランチと幾何ブランチの間で相互監督を可能にし、一般化性能を向上させること。

提案手法

  • TextScanner は二重ブランチアーキテクチャを採用しており、一方のブランチはマルチチャネルセグメンテーションマップを用いて文字クラス確率を予測する。
  • もう一方のブランチは、専用の幾何マップを用いて文字の位置と順序を予測し、順序は別々のチャネルに符号化される。
  • 文字インスタンスは、分類マップと幾何マップの要素ごとの乗算により生成され、各チャネルに対して argmax を適用して(位置、順序、クラス)を抽出する。
  • 訓練中に相互監督メカニズムを活用し、幾何監視が分類を改善し、逆に分類監視が幾何予測を向上させる。
  • SynthText を用いた合成データ生成パイプラインを活用し、多様なテキストレイアウトで事前学習し、実データで微調整する。
  • 分類には交差エントロピー損失、局所化と順序予測には L1 損失を用いて、エンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1セグメンテーションベースの手法は、推論時の注目メカニズムのずれに対し、RNN-アテンションモデルよりも優れた耐障害性を示せるか?
  • RQ2幾何ブランチにおける明示的な順序監視は、閾値ベースの連結成分検出による誤りを低減できるか?
  • RQ3分類と幾何予測の分離は、曲がったや複雑なテキスト(例:中国語テキスト)に対して性能にどのように影響を与えるか?
  • RQ4分類ブランチと幾何ブランチの間の相互監督は、認識正確性をどの程度向上させるか?
  • RQ5多様な形状と外観を持つ実世界のシーンテキストに対し、モデルは効果的に一般化できるか?

主な発見

  • TextScanner は MLT-17 ベンチマークで 64.1% の正確性と 0.75 の正規化編集距離を達成し、CRNN(59.2% の正確性、0.68 NED)と ASTER(57.4% の正確性、0.69 NED)を上回った。
  • IC13 では、62.3% の予測が真値から 0.1 の正規化距離以内に位置しており、アテンションベースのモデルに比べて顕著に高い局所化正確性を示した。
  • アブレーションスタディにより、幾何ブランチ単体でも IIIT で 0.6%、SVT で 0.9%、IC13 で 3.1% の正確性向上が確認され、その有効性が裏付けられた。
  • 順序マップの導入により、IC15 で 1.4%、SVTP で 2.5% の性能向上が得られ、不規則なテキストに対して顕著な向上が確認された。
  • 相互監督メカニズムにより、合成データでの事前学習後に実データで微調整する際の一般化性能が向上した。
  • 閾値依存の手法を避けることで、不正な文字や欠落文字が減少し、困難なデータセットにおける定性的・定量的評価で裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。