[論文レビュー] Sequence to Sequence Learning for Optical Character Recognition
本論文は、LSTMを用いた符号化と復号化により、可変長の単語画像を可変長のテキスト系列にマッピングするエンド・ツー・エンドの再帰的エンコーダ・デコーダアーキテクチャを提案する。この手法は、CTCベースのモデルと同等の性能を達成し、固定次元の表現力のある単語埋め込みを生成する。これにより、従来のbag-of-wordsやSIFTベースの手法と比較して、検索の効率性と正確性が顕著に向上する。
We propose an end-to-end recurrent encoder-decoder based sequence learning approach for printed text Optical Character Recognition (OCR). In contrast to present day existing state-of-art OCR solution which uses connectionist temporal classification (CTC) output layer, our approach makes minimalistic assumptions on the structure and length of the sequence. We use a two step encoder-decoder approach -- (a) A recurrent encoder reads a variable length printed text word image and encodes it to a fixed dimensional embedding. (b) This fixed dimensional embedding is subsequently comprehended by decoder structure which converts it into a variable length text output. Our architecture gives competitive performance relative to connectionist temporal classification (CTC) output layer while being executed in more natural settings. The learnt deep word image embedding from encoder can be used for printed text based retrieval systems. The expressive fixed dimensional embedding for any variable length input expedites the task of retrieval and makes it more efficient which is not possible with other recurrent neural network architectures. We empirically investigate the expressiveness and the learnability of long short term memory (LSTMs) in the sequence to sequence learning regime by training our network for prediction tasks in segmentation free printed text OCR. The utility of the proposed architecture for printed text is demonstrated by quantitative and qualitative evaluation of two tasks -- word prediction and retrieval.
研究の動機と目的
- 分離処理を回避し、可変長の入力を扱えるエンド・ツー・エンドのディープラーニングモデルを、印刷文字認識用に開発すること。
- OCRにおけるシーケンス・ツー・シーケンス学習におけるLSTMの表現力と学習可能性を調査すること。
- エンコーダーから得られる固定次元のディープな単語画像埋め込みを用いて、効率的かつ正確な単語検索を可能にすること。
- 提案アーキテクチャが単語予測および画像ベースのテキスト検索の両方で有効であることを実証すること。
提案手法
- 可変長の単語画像を処理し、固定次元のコンテキストベクトルを生成するために、双方向LSTMエンコーダーを用いる。
- 固定次元の埋め込みから可変長のテキスト出力を生成するために、条件付きLSTMデコーダーを採用する。
- 交差エントロピー損失を用いたシーケンス・ツー・シーケンス学習により、エンコーダ・デコーダアーキテクチャをエンド・ツー・エンドで学習する。
- 検索タスク用に、エンコーダーの最終隠れ状態をディープ・ワード・イメージ・エンベディング(DwIE)として抽出する。
- DwIE特徴量を用いて近似最近傍探索を実行し、効率的な検索を実現する。
- ベースラインとしてCTCベースのLSTM、Tesseract、およびAbbyyを用いて性能を評価する。
実験結果
リサーチクエスチョン
- RQ1シーケンス・ツー・シーケンスLSTMエンコーダ・デコーダモデルは、CTCベースのモデルと比較して、分離処理を伴わない印刷文字認識で競争力のある性能を達成できるか?
- RQ2エンコーダーが学習する固定次元の埋め込みは、後続の検索タスクにおいてどれほど表現力があるか?
- RQ3提案アーキテクチャは、従来のbag-of-wordsおよびSIFTベースの表現と比較して、単語画像検索で優れた性能を発揮できるか?
- RQ4予測および埋め込み学習の過程で、単語長や文字構造の変化に対し、モデルはどのように対処するか?
主な発見
- LSTMエンコーダ・デコーダモデルは、通常のRNNを上回り、CTCベースのLSTMおよびAbbyyのような商用ツールと同等またはそれ以上の単語予測精度を達成する。
- ディープ・ワード・イメージ・エンベディング(DwIE)は、SIFTベースのbag-of-wordsや拡張プロファイル特徴量と比較して、トップ100およびトップ5000の検索精度で顕著に優れている。
- トップ5000の検索において、DwIE特徴量はAbbyyの商用OCRを上回る性能を示す一方、トップ100の検索では同等の性能を発揮する。
- t-SNE可視化により、DwIE埋め込みが構造的および言語的類似性を捉えていることが確認され、'm'と'M'、'a'と'A'、数字などがクラスタリングされている。
- モデルは小さな画像成分(例:ピリオド)に対して高い感度を示し、bag-of-wordsでは完全に失敗するようなクエリ(例:'A.')においても、検索精度が向上する。
- 収束曲線から、エンコーダ・デコーダモデルは安定した学習を示しており、固定次元の埋め込みのおかげで、より高速な検索が可能になる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。