Skip to main content
QUICK REVIEW

[論文レビュー] Accurate, Data-Efficient, Unconstrained Text Recognition with Convolutional Neural Networks

Mohamed Yousef, Khaled F. Hussain|arXiv (Cornell University)|Dec 31, 2018
Handwritten Text Recognition Techniques被引用数 9
ひとこと要約

本論文は、再帰的接続を用いず、7つのベンチマークデータセットで最先端の性能を達成する、汎用的で制約のない文字認識のための単純で完全に畳み込み型のエンドツーエンドの深層学習アーキテクチャを提案する。モデルは深度分離畳み込みを用い、ゲーティング付きの新規階層間残差接続とCTC損失を採用しており、最小限のデータと推論遅延で高い精度を実現する。

ABSTRACT

Unconstrained text recognition is an important computer vision task, featuring a wide variety of different sub-tasks, each with its own set of challenges. One of the biggest promises of deep neural networks has been the convergence and automation of feature extractors from input raw signals, allowing for the highest possible performance with minimum required domain knowledge. To this end, we propose a data-efficient, end-to-end neural network model for generic, unconstrained text recognition. In our proposed architecture we strive for simplicity and efficiency without sacrificing recognition accuracy. Our proposed architecture is a fully convolutional network without any recurrent connections trained with the CTC loss function. Thus it operates on arbitrary input sizes and produces strings of arbitrary length in a very efficient and parallelizable manner. We show the generality and superiority of our proposed text recognition architecture by achieving state of the art results on seven public benchmark datasets, covering a wide spectrum of text recognition tasks, namely: Handwriting Recognition, CAPTCHA recognition, OCR, License Plate Recognition, and Scene Text Recognition. Our proposed architecture has won the ICFHR2018 Competition on Automated Text Recognition on a READ Dataset.

研究の動機と目的

  • 制約のない文字認識のための汎用的でデータ効率の良いニューラルネットワークアーキテクチャを開発すること。
  • 再帰的ネットワークを排除するため、新規のアーキテクチャ的要素を備えたフィードフォワード畳み込み層のみを用いて、文字認識に特化したモデルを不要にする。
  • 新規の正規化およびゲーティング機構を通じて、モデルの効率性と頑健性を向上させつつ、高い精度を維持すること。
  • 手書き文字、シーンテキスト、CAPTCHA、車両ナンバープレートを含む多様な文字認識タスクにわたるアーキテクチャの汎用性を示すこと。
  • 複数のベンチマークで最先端の性能を達成する統一的で最小限のハイパーパrameterを有するソリューションを確立すること。

提案手法

  • 計算効率を高めるために、深度分離畳み込みに基づく完全に畳み込み型のニューラルネットワークである。
  • 訓練の安定性と勾配の流れの改善を図るために、学習可能なゲーティング機構を備えた新規の階層間残差接続を組み込む。
  • 正規化にはレイヤー正規化とバッチ正規化を適用し、ゲートブロックの直前にソフトマックスを適用してゲーティング信号の安定化を図る。
  • シーケンスから文字列へのマッピングのために、接続主義的時系列分類(CTC)損失を用いてエンドツーエンドで学習する。
  • すべての文字認識タスクに適用可能な汎用的なデータ拡張技術のセットを提案し、モデルの頑健性と一般化性能を向上させる。
  • 入力サイズに制限がなく、完全に並列化可能な方法で可変長出力を生成する。

実験結果

リサーチクエスチョン

  • RQ1再帰的接続を一切含まない完全に畳み込み型のネットワークが、制約のない文字認識で最先端の性能を達成できるか?
  • RQ2ゲーティング付きの階層間残差接続は、文字認識モデルの性能と訓練の安定性にどのように寄与するか?
  • RQ3レイヤー正規化とバッチ正規化といった異なる正規化方式の、モデルの収束と精度への影響は何か?
  • RQ41つの統一されたアーキテクチャが、最小限のハイパーパrameterチューニングで多様な文字認識タスクでSOTA性能を達成できるか?
  • RQ5汎用的なデータ拡張技術は、異なる文字認識ドメイン間でのモデル一般化性能の向上にどの程度効果的か?

主な発見

  • 提案アーキテクチャは、IAM、KHATT、SVHN、UW3、AOLP、reCAPTCHAを含む7つの公開ベンチマークデータセットで最先端の性能を達成した。
  • reCAPTCHAデータセットでは、人間レベルの性能に到達し、前回のRCNシステムと比較して認識率が20%絶対的に向上した。
  • ICFHR2018のREADデータセットコンペティションで優勝し、2位の参加者と比較して文字誤り率(CER)が25%以上相対的に低減した。
  • アブレーションスタディの結果、レイヤー正規化を削除するとCERが約30%上昇し、モデルの安定性においてその重要性が顕著に示された。
  • 残差接続とゲーティング機構を備えたモデルは、そのような構成を有しないベースラインモデルと比較してCERを相対的に20%低減した。
  • IAMデータセットでは、わずかなパラメータ予算(約71kパラメータ)で検証CERが22.85%に達し、高いデータ効率を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。