Skip to main content
QUICK REVIEW

[論文レビュー] Deep Self-Taught Learning for Handwritten Character Recognition

Frédéric Bastien, Yoshua Bengio|arXiv (Cornell University)|Sep 18, 2010
Handwritten Text Recognition Techniques参考文献 24被引用数 13
ひとこと要約

この論文では、確率的データ拡張を用いた深層自己教師付き学習により、手書き文字認識の性能を向上させる手法を提案している。ノイズ、変形、背景の変化を含む、大幅に摂動を加えたり分布外の画像である手書き文字画像を用いて、スタックドノイズ除去オートエンコーダー(SDA)を訓練することで、MNISTの数字認識および62クラスのNIST文字認識の両方で人間水準の性能を達成し、浅層モデルや先行の最先端手法を上回った。

ABSTRACT

Recent theoretical and empirical work in statistical machine learning has demonstrated the importance of learning algorithms for deep architectures, i.e., function classes obtained by composing multiple non-linear transformations. Self-taught learning (exploiting unlabeled examples or examples from other distributions) has already been applied to deep learners, but mostly to show the advantage of unlabeled examples. Here we explore the advantage brought by {\em out-of-distribution examples}. For this purpose we developed a powerful generator of stochastic variations and noise processes for character images, including not only affine transformations but also slant, local elastic deformations, changes in thickness, background images, grey level changes, contrast, occlusion, and various types of noise. The out-of-distribution examples are obtained from these highly distorted images or by including examples of object classes different from those in the target test set. We show that {\em deep learners benefit more from out-of-distribution examples than a corresponding shallow learner}, at least in the area of handwritten character recognition. In fact, we show that they beat previously published results and reach human-level performance on both handwritten digit classification and 62-class handwritten character recognition.

研究の動機と目的

  • 深層アーキテクチャが、手書き文字認識において浅層モデルよりも分布外の例にどれほど恩恵を受けるかを調査すること。
  • ノイズ、変形、背景の変化などの広範なデータ拡張が、クリーンで現実世界のテストデータへの一般化に与える影響を評価すること。
  • 訓練時に関連するが異なる複数の文字クラスを用いたマルチタスク学習が、ターゲットタスクの性能向上に寄与するかどうかを評価すること。
  • 豊富なラベル付きデータが存在する状況でも、教師なし事前学習が純粋に教師あり学習よりも優れた一般化性能を実現するかどうかを検証すること。
  • 自己教師付き学習を用いた深層学習が、大規模な手書き文字認識ベンチマークで、過去の最先端手法を上回ることを示すこと。

提案手法

  • 著者らは、アフィン変換、傾き、弾性変形、太さの変化、背景画像、コントラストのシフト、部分的遮蔽、ノイズを含む、大幅に摂動を加えた文字画像を生成する確率的画像変換システムを開発した。
  • スタックドノイズ除去オートエンコーダー(SDA)を深層アーキテクチャとして用い、階層的特徴表現を学習するために、ノイズ除去オートエンコーディングを用いて層ごとに事前学習した。
  • SDAは、ラベル付きデータを用いた教師あり学習で微調整されたが、訓練データは確率的変換パイプラインを用いてデータ拡張され、分布外の例を模倣した。
  • マルチタスク学習のため、モデルは全62文字クラス(数字、大文字、小文字)を同時に学習し、テストではサブセット(例:数字のみ)に対して性能を比較した。
  • ハイパーパrameterは検証セットを用いて選定され、性能はNIST特別データベース19のクリーンなテストセットで評価された。
  • 同じデータ拡張および評価プロトコルを用いて、摂動を加えたデータで学習した浅層の多層パーセプトロン(MLP)と比較した。

実験結果

リサーチクエスチョン

  • RQ1深層アーキテクチャは、手書き文字認識において、浅層モデルよりも分布外の例(例:大幅に摂動を加えた画像)にどれほど恩恵を受けるか?
  • RQ2拡張された分布外データで学習することで、クリーンで元のテストデータへの性能向上はどの程度達成されるか?
  • RQ3複数の関連する文字クラスで学習するマルチタスク学習は、深層学習者にとって浅層学習者よりもより大きな利益をもたらすか?
  • RQ4ラベル付きデータが豊富に存在する状況でも、未ラベルで多様なデータを用いた自己教師付き学習が、深層モデルの一般化性能を向上させられるか?
  • RQ5教師なし事前学習とデータ拡張を用いた深層学習は、大規模な手書き文字認識タスクで人間水準の性能に達成できるか?

主な発見

  • SDAモデルは10クラスのMNIST数字認識タスクで1.4%のテスト誤差率を達成し、人間水準の性能を再現し、同じテストセットで発表済みのすべての先行研究を上回った。
  • 62クラスのNIST文字認識タスクでは、摂動を加えたデータ(NISTP)で学習したSDAが18.7%のテスト誤差率を達成し、同じ条件下で浅層MLPの24.3%を大きく上回った。
  • クリーンな数字データでの誤差率の相対的改善は、SDAでは93%であったが、MLPではわずか-10%にとどまり、深層モデルがデータ拡張により著しく恩恵を受けることが示された。
  • SDAは、数字、大文字、小文字を同時に3つのタスクで学習した場合、各タスクを個別に学習した場合と比較して誤差率に27%の相対的改善を示したが、MLPは数字タスクでの改善がわずか5.6%にとどまった。
  • クリーンなデータでのテストでは、非常に摂動を加えたデータ(P07)で学習したSDAが、クリーンデータでのみ学習した場合に比べて誤差率を228%も削減した。これは、分布外の例から強力な一般化が可能であることを示している。
  • SDAはNIST特別データベース19において、10クラスおよび62クラスの両タスクで、当時報告された最低の誤差率を達成し、すべての先行最先端手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。