Skip to main content
QUICK REVIEW

[論文レビュー] Offline Handwritten Chinese Text Recognition with Convolutional Neural Networks

Brian Liu, Xianchao Xu|arXiv (Cornell University)|Jun 28, 2020
Handwritten Text Recognition Techniques参考文献 26被引用数 9
ひとこと要約

本稿では、接続主義的時系列分類(CTC)損失を用いた、再帰型層を含まない畳み込みニューラルネットワーク(CNN)ベースのアプローチを提案する。高レートのドロップアウトと、合成文字テンプレートを用いたデータ拡張を適用することで、言語モデル補正を用いない状態で、ICDAR 2013ベンチマークで最先端の6.81%の文字誤り率(CER)を達成した。

ABSTRACT

Deep learning based methods have been dominating the text recognition tasks in different and multilingual scenarios. The offline handwritten Chinese text recognition (HCTR) is one of the most challenging tasks because it involves thousands of characters, variant writing styles and complex data collection process. Recently, the recurrent-free architectures for text recognition appears to be competitive as its highly parallelism and comparable results. In this paper, we build the models using only the convolutional neural networks and use CTC as the loss function. To reduce the overfitting, we apply dropout after each max-pooling layer and with extreme high rate on the last one before the linear layer. The CASIA-HWDB database is selected to tune and evaluate the proposed models. With the existing text samples as templates, we randomly choose isolated character samples to synthesis more text samples for training. We finally achieve 6.81% character error rate (CER) on the ICDAR 2013 competition set, which is the best published result without language model correction.

研究の動機と目的

  • 数千の漢字と高いスタイルのばらつきを示すオフライン手書き中国語テキスト認識の課題に対処すること。
  • 高い並列性と効率的な学習を可能にする再帰型層を含まないアーキテクチャの開発。
  • 限られた手書きデータで学習するモデルの過学習を、戦略的なドロップアウトの適用によって低減すること。
  • 既存のテキストテンプレートを用いた合成による追加のトレーニングサンプルの生成により、一般化性能の向上。
  • 言語モデル補正に依存しない状態で、ICDAR 2013ベンチマークで最先端のパフォーマンスを達成すること。

提案手法

  • モデルは再帰型ニューラルネットワークを一切使用せず、畳み込みニューラルネットワークのみを用いることで、高度に並列化された学習を可能にした。
  • 系列から系列へのアラインメントを明示的に処理せず、系列間の対応を処理できるように、接続主義的時系列分類(CTC)を損失関数として採用した。
  • 各マックスプーリング層の直後にドロップアウト層を適用し、線形分類器の直前で最終層に非常に高いドロップアウト率を適用することで、過学習を軽減した。
  • 既存のテキストサンプルから分離された文字をランダムに選択して、新しい系列を形成することで、合成トレーニングサンプルを生成した。
  • CASIA-HWDBデータセットを用いてモデルのチューニングと評価を行い、中国語手書きのための大規模なベンチマークを提供した。
  • テンプレートベースの合成によるデータ拡張により、トレーニングの多様性が向上し、モデルのロバスト性が向上した。

実験結果

リサーチクエスチョン

  • RQ1完全に畳み込みニューラルネットワークアーキテクチャが、再帰型コンponentを含まない状態で、オフライン手書き中国語テキスト認識において競争力のある性能を達成できるか?
  • RQ2限られた手書き中国語データセットにおいて、最終層に高レートのドロップアウトを適用することで、過学習がどの程度軽減されるか?
  • RQ3既存のテキストテンプレートから生成された合成データが、モデルの一般化性能と認識精度をどの程度向上できるか?
  • RQ4CTC損失関数は、純粋なCNNアーキテクチャのためのエンドツーエンド学習を効果的に可能にするか?
  • RQ5言語モデル統合なしで、CNNオンリーモデルがICDAR 2013ベンチマークで達成できるパフォーマンスの上限は何か?

主な発見

  • 提案されたCNNオンリーモデルは、ICDAR 2013コンペティションのテストセットで6.81%の文字誤り率(CER)を達成し、言語モデル補正を用いない状態で報告された最高の結果である。
  • 最終のマックスプーリング層の直後に高レートのドロップアウトを適用することで、限られたトレーニングデータにおける過学習が顕著に低減された。
  • 既存のテキストテンプレートから生成された合成データは、トレーニングの多様性を効果的に増加させ、モデルの一般化性能を向上させた。
  • 再帰型なしのアーキテクチャにより、高度に並列化された学習が可能となり、RNNベースのモデルと比較して競争力ある性能を維持した。
  • モデルは、手書き中国語テキストにおけるスタイルのばらつきや複雑な書体パターンに対しても、強いロバスト性を示した。
  • 結果から、CTC損失が系列認識タスクにおける純粋なCNNアーキテクチャのエンドツーエンド学習に有効であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。