Skip to main content
QUICK REVIEW

[論文レビュー] Dropout is a special case of the stochastic delta rule: faster and more accurate deep learning

Noah Frazier-Logue, Stephen José Hanson|arXiv (Cornell University)|Aug 10, 2018
Adversarial Robustness in Machine Learning参考文献 5被引用数 8
ひとこと要約

この論文は、ドロップアウトが、各重みが学習可能な平均と標準偏差をもつガウス分布に従う確率的変数としてモデル化されるより一般的な枠組み、Stochastic Delta Rule (SDR) の特殊ケースであることを示している。SDRは、CIFAR-100でテスト誤差を最大17%低減させるとともに収束を加速し、ドロップアウトと同等の精度に到達するのに35%の学習時間を要する。

ABSTRACT

Multi-layer neural networks have lead to remarkable performance on many kinds of benchmark tasks in text, speech and image processing. Nonlinear parameter estimation in hierarchical models is known to be subject to overfitting and misspecification. One approach to these estimation and related problems (local minima, colinearity, feature discovery etc.) is called Dropout (Hinton, et al 2012, Baldi et al 2016). The Dropout algorithm removes hidden units according to a Bernoulli random variable with probability $p$ prior to each update, creating random "shocks" to the network that are averaged over updates. In this paper we will show that Dropout is a special case of a more general model published originally in 1990 called the Stochastic Delta Rule, or SDR (Hanson, 1990). SDR redefines each weight in the network as a random variable with mean $μ_{w_{ij}}$ and standard deviation $σ_{w_{ij}}$. Each weight random variable is sampled on each forward activation, consequently creating an exponential number of potential networks with shared weights. Both parameters are updated according to prediction error, thus resulting in weight noise injections that reflect a local history of prediction error and local model averaging. SDR therefore implements a more sensitive local gradient-dependent simulated annealing per weight converging in the limit to a Bayes optimal network. Tests on standard benchmarks (CIFAR) using a modified version of DenseNet shows the SDR outperforms standard Dropout in test error by approx. $17\%$ with DenseNet-BC 250 on CIFAR-100 and approx. $12-14\%$ in smaller networks. We also show that SDR reaches the same accuracy that Dropout attains in 100 epochs in as few as 35 epochs.

研究の動機と目的

  • ドロップアウトとStochastic Delta Rule (SDR) の間の理論的関係を確立すること。SDRは古くからあるが、より一般的な学習フレームワークである。
  • 重みを学習可能な確率的変数としてモデル化するSDRが、標準ドロップアウトよりも一般化性能および学習効率を向上させるかを調査すること。
  • 最先端のDenseNetアーキテクチャを用いて、CIFAR-10 や CIFAR-100 といった標準ベンチマーク上でのSDRの性能を評価すること。
  • SDRがドロップアウトよりも高いテスト精度を達成しながら、より速い収束を実現することを示すこと。

提案手法

  • SDRは、各重みを学習可能な平均μと標準偏差σを持つガウス分布に従う確率的変数としてモデル化し、各順伝播計算でサンプリングする。
  • 各重みの平均と標準偏差は、予測誤差の勾配に基づいて更新され、誤差依存的なノイズ注入が可能になる。
  • SDRは、学習中に指数的数の重み設定を確率的サンプリングすることで、局所的なモデルアンサンブルを実現する。
  • SDRは、勾配と重みへのアクセスが可能であれば、既存のディープラーニングフレームワークに最小限のコード変更で自然に統合できる。
  • SDRはDenseNet-BCアーキテクチャに実装され、固定されたハイパーパrameterを用いてCIFAR-10およびCIFAR-100で評価された。
  • 訓練プロセスでは、局所的な予測誤差履歴を反映する適応的ノイズ注入が行われ、重み空間の動的探索が可能になる。

実験結果

リサーチクエスチョン

  • RQ1ドロップアウトは、数学的にStochastic Delta Rule (SDR) の特定のインスタンスとして等価であるか?
  • RQ2SDRは、標準的な画像分類ベンチマークにおいて、標準ドロップアウトよりも優れた一般化性能を達成できるか?
  • RQ3SDRは、ドロップアウトと同等またはそれ以上のテスト精度を維持しながら、学習時間を短縮できるか?
  • RQ4SDRの適応的ノイズ注入は、ドロップアウトの固定ベルヌーイドロップアウトと比較して、収束速度および最終的な性能において優れているか?

主な発見

  • SDRは、CIFAR-100のDenseNet-BC 250において、標準ドロップアウトと比較してテスト誤差を約17%低減した。
  • SDRは、より小さなDenseNetアーキテクチャ(例:DenseNet-40)において、CIFAR-100で12–14%のテスト誤差低減を達成した。
  • SDRは、ドロップアウトが100エポックを要するのに対し、わずか35エポックで同じ最終検証誤差に到達した。
  • SDRは、すべてのベンチマークで学習損失を80%以上低減させ、DenseNet-BC 250を用いたCIFAR-100では最終損失が0.11にまで低下した。
  • 121層のDenseNetを用いたImageNetの予備結果では、SDRはドロップアウトと比較して誤差率を9%改善した(28.35から25.80に)。
  • 重みの標準偏差パrameterは、学習終了時点でほぼゼロに収束しており、安定的で低ノイズの最終モデルであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。