Skip to main content
QUICK REVIEW

[論文レビュー] Improved Dropout for Shallow and Deep Learning

Zhe Li, Boqing Gong|arXiv (Cornell University)|Feb 6, 2016
Advanced Neural Network Applications参考文献 19被引用数 12
ひとこと要約

本稿では、2次統計に基づいて特徴量またはニューロンを適応的にサンプリングすることで、浅層学習および深層学習における収束性と一般化性能を向上させる、分布依存の多項分布ドロップアウト手法を提案する。進化的ドロップアウトはミニバッチからの統計を即時に計算してサンプリング確率を決定し、CIFAR-100において標準ドロップアウトと比較して収束が50%以上速く、テスト誤差が10%以上相対的に改善される。

ABSTRACT

Dropout has been witnessed with great success in training deep neural networks by independently zeroing out the outputs of neurons at random. It has also received a surge of interest for shallow learning, e.g., logistic regression. However, the independent sampling for dropout could be suboptimal for the sake of convergence. In this paper, we propose to use multinomial sampling for dropout, i.e., sampling features or neurons according to a multinomial distribution with different probabilities for different features/neurons. To exhibit the optimal dropout probabilities, we analyze the shallow learning with multinomial dropout and establish the risk bound for stochastic optimization. By minimizing a sampling dependent factor in the risk bound, we obtain a distribution-dependent dropout with sampling probabilities dependent on the second order statistics of the data distribution. To tackle the issue of evolving distribution of neurons in deep learning, we propose an efficient adaptive dropout (named extbf{evolutional dropout}) that computes the sampling probabilities on-the-fly from a mini-batch of examples. Empirical studies on several benchmark datasets demonstrate that the proposed dropouts achieve not only much faster convergence and but also a smaller testing error than the standard dropout. For example, on the CIFAR-100 data, the evolutional dropout achieves relative improvements over 10\% on the prediction performance and over 50\% on the convergence speed compared to the standard dropout.

研究の動機と目的

  • 独立同分布(i.i.d.)サンプリングを用いる標準ドロップアウトの収束性が最適でない問題に対処するため、より効果的なサンプリング戦略を提案すること。
  • データの2次統計から導出されるサンプリング確率を用いた分布依存ドロップアウトが、リスクを最小化することを理論的に裏付けること。
  • 内部分布の変化に適応するため、ミニバッチごとにサンプリング確率を動的に更新する効率的で適応的なドロップアウト手法「進化的ドロップアウト」を深層学習に開発すること。
  • 提唱されたドロップアウトが、ベンチマークデータセット全体で収束速度およびテスト誤差において標準ドロップアウトを上回ることを実験的に検証すること。

提案手法

  • 特徴量またはニューロンを、分散や2次統計に基づいて非一様確率でサンプリングする多項分布ドロップアウトを提案する。
  • 多項分布ドロップアウトを用いた確率的最適化におけるリスクバウンドを導出し、分布依存サンプリングが期待リスクを低減することを示す。
  • 学習特徴量の2次統計を用いてサンプリング確率を設定する、浅層学習向けのデータ依存ドロップアウトを導入する。
  • 層出力のミニバッチ統計から即時にサンプリング確率を計算する進化的ドロップアウトを、深層学習に向け開発する。これにより、変化する内部分布に適応できる。
  • ミニバッチ統計を用いて効率的にサンプリング確率を計算し、深層ネットワークにおける並列処理とスケーラビリティを実現する。
  • この手法をデータ依存正則化子として扱い、標準的なバックプロパゲーションおよび推論と互換性を保つ。

実験結果

リサーチクエスチョン

  • RQ1特徴量の分散に基づくデータ依存確率を用いた多項分布サンプリングは、浅層学習におけるi.i.d.ドロップアウトと比較して収束性および一般化性能を向上させることができるか?
  • RQ2ドロップアウトを用いた確率的最適化において、リスクを最小化するためのサンプリング確率はどのように最適に設定できるか?
  • RQ3深層ネットワークにおける、適応的かつ即時のサンプリング確率は、内部分布シフトを効果的に緩和し、学習を加速させることができるか?
  • RQ4収束速度およびテスト精度の観点から、進化的ドロップアウトはバッチ正規化と比較してどのように異なるか?

主な発見

  • CIFAR-100において、進化的ドロップアウトは標準ドロップアウトと比較して収束が50%以上速く、テスト誤差が10%以上相対的に改善された。
  • 進化的ドロップアウトは、CIFAR-10において標準ドロップアウトを用いたバッチ正規化と同等の性能を達成しており、内部分布シフトの緩和効果を示している。
  • 浅層学習においては、特徴量の分散に基づくデータ依存ドロップアウトが一様ドロップアウトよりも収束が速い。
  • 提案手法はリスクバウンド最小化の理論的裏付けを有しており、分布依存サンプリングがより小さい期待リスクをもたらすことを示している。
  • 追加のパラメータや層を導入しないため、シンプルさと標準的な深層学習フレームワークとの互換性を維持している。
  • MNIST、SVHN、CIFAR-10、CIFAR-100の全データセットで一貫した改善が得られ、本手法の頑健性と一般化性能の高さが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。