Skip to main content
QUICK REVIEW

[論文レビュー] DropSample: A New Training Method to Enhance Deep Convolutional Neural Networks for Large-Scale Unconstrained Handwritten Chinese Character Recognition

Weixin Yang, Lianwen Jin|arXiv (Cornell University)|May 20, 2015
Handwritten Text Recognition Techniques参考文献 57被引用数 4
ひとこと要約

本稿では、分類の信頼度に基づいてトレーニングサンプルを動的に再重み付けする、深層畳み込みニューラルネットワーク(DCNN)のための新しいトレーニング手法であるDropSampleを紹介する。低信頼度のサンプルを優先することで、学習効率を向上させる。大規模な非制約的手書き中国文字認識に適用したところ、ドメイン固有の知識レイヤーを組み合わせたDropSampleは、それぞれCASIA-OLHDWB 1.0、CASIA-OLHWDB 1.1、ICDAR 2013データセットで97.33%、97.06%、97.51%の最先端の正確性を達成した。

ABSTRACT

Inspired by the theory of Leitners learning box from the field of psychology, we propose DropSample, a new method for training deep convolutional neural networks (DCNNs), and apply it to large-scale online handwritten Chinese character recognition (HCCR). According to the principle of DropSample, each training sample is associated with a quota function that is dynamically adjusted on the basis of the classification confidence given by the DCNN softmax output. After a learning iteration, samples with low confidence will have a higher probability of being selected as training data in the next iteration; in contrast, well-trained and well-recognized samples with very high confidence will have a lower probability of being involved in the next training iteration and can be gradually eliminated. As a result, the learning process becomes more efficient as it progresses. Furthermore, we investigate the use of domain-specific knowledge to enhance the performance of DCNN by adding a domain knowledge layer before the traditional CNN. By adopting DropSample together with different types of domain-specific knowledge, the accuracy of HCCR can be improved efficiently. Experiments on the CASIA-OLHDWB 1.0, CASIA-OLHWDB 1.1, and ICDAR 2013 online HCCR competition datasets yield outstanding recognition rates of 97.33%, 97.06%, and 97.51% respectively, all of which are significantly better than the previous best results reported in the literature.

研究の動機と目的

  • 大規模な非制約的手書き中国文字認識(HCCR)における深層畳み込みニューラルネットワーク(DCNN)の効率性と正確性を向上させること。
  • すでに適切に認識済みのサンプルに対する冗長なトレーニングが原因で生じるDCNNの学習効率の悪さという課題に対処すること。
  • 困難で低信頼度のサンプルに適応的に注目する動的サンプリング戦略を開発すること。
  • CNNアーキテクチャにドメイン固有の知識を統合することで、認識性能をさらに向上させること。

提案手法

  • DropSampleは、各トレーニングサンプルに対して、学習イテレーションごとにDCNNのソフトマックス信頼度出力に基づいて動的に調整されるクォータ関数を導入する。
  • 分類の信頼度が低いサンプルは、その後のトレーニングイテレーションで選択確率が高くなるように設定され、学習への寄与度が向上する。
  • 適切に分類された高信頼度のサンプルは徐々に優先度が下げられ、トレーニングから除外されることで冗長性が低減され、効率が向上する。
  • 従来のCNNの前にドメイン知識レイヤーを挿入し、タスク固有の不変性および構造的事前知識をネットワークに組み込む。
  • 動的サンプリングとアーキテクチャ上のインダクティブバイアスを組み合わせることで、特徴学習と一般化性能が向上する。
  • トレーニングプロセスは、ハード例に注目することでモデル容量を段階的に最適化し、認知心理学のレイトナー学習ボックス原理を模倣する。

実験結果

リサーチクエスチョン

  • RQ1モデルの信頼度に基づくトレーニングサンプルの動的再重み付けが、HCCRにおけるDCNNの収束性と正確性を向上させることができるか?
  • RQ2低信頼度のサンプルを優先することで、学習効率と最終的な認識性能にどのような影響を与えるか?
  • RQ3ドメイン固有の知識をどれだけ統合すれば、非制約的手書き中国文字認識におけるDCNN性能を向上させられるか?
  • RQ4動的サンプリングとアーキテクチャ上のインダクティブバイアスの組み合わせが、標準的なトレーニングプロトコルに比べて優れた結果をもたらすか?

主な発見

  • DropSampleはCASIA-OLHDWB 1.0データセットで97.33%の認識正確性を達成し、以前の最先端結果を上回った。
  • CASIA-OLHWDB 1.1データセットでは97.06%の正確性を達成し、異なるデータ分布に対しても高い頑健性を示した。
  • ICDAR 2013オンラインHCCRベンチマークでは97.51%の認識率を達成し、新たな最先端性能を樹立した。
  • ドメイン固有の知識をDropSampleと統合することで、モデルの一般化性能と収束速度が顕著に向上した。
  • 動的サンプリング機構により、高信頼度のサンプルの優先度を下げることでトレーニングの冗長性が低減され、より高速で効率的な学習が実現した。
  • 本手法の有効性は、3つの多様で大規模なHCCRベンチマークで検証され、一般化可能性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。