Skip to main content
QUICK REVIEW

[論文レビュー] Critical initialisation for deep signal propagation in noisy rectifier neural networks

Arnu Pretorius, Elan van Biljon|arXiv (Cornell University)|Nov 1, 2018
Stochastic Gradient Optimization Techniques被引用数 10
ひとこと要約

本稿では、ノイズあり整流器ニューラルネットワークにおける信号伝播の一般化平均場理論を構築し、加法的ノイズでは臨界初期化が不可能であるが、ノイズ分散を考慮すれば乗法的ノイズ(例:ドロップアウト)では可能であることを示している。深層信号伝播を安定化させるための新たな初期化戦略を導出し、MNIST や CIFAR-10 におけるシミュレーションと実世界の実験を通じて、ノイズが入力相関を増加させることで、臨界状態であってもトレーニング可能深度が減少することを明らかにした。

ABSTRACT

Stochastic regularisation is an important weapon in the arsenal of a deep learning practitioner. However, despite recent theoretical advances, our understanding of how noise influences signal propagation in deep neural networks remains limited. By extending recent work based on mean field theory, we develop a new framework for signal propagation in stochastic regularised neural networks. Our noisy signal propagation theory can incorporate several common noise distributions, including additive and multiplicative Gaussian noise as well as dropout. We use this framework to investigate initialisation strategies for noisy ReLU networks. We show that no critical initialisation strategy exists using additive noise, with signal propagation exploding regardless of the selected noise distribution. For multiplicative noise (e.g. dropout), we identify alternative critical initialisation strategies that depend on the second moment of the noise distribution. Simulations and experiments on real-world data confirm that our proposed initialisation is able to stably propagate signals in deep networks, while using an initialisation disregarding noise fails to do so. Furthermore, we analyse correlation dynamics between inputs. Stronger noise regularisation is shown to reduce the depth to which discriminatory information about the inputs to a noisy ReLU network is able to propagate, even when initialised at criticality. We support our theoretical predictions for these trainable depths with simulations, as well as with experiments on MNIST and CIFAR-10

研究の動機と目的

  • 確率的正則化(例:ドロップアウト、ガウスノイズ)が深層 ReLU ネットワークにおける信号伝播に与える影響を理解すること。
  • さまざまなノイズ分布のもとで、信号伝播を安定化させる「臨界初期化」が依然として可能かどうかを特定すること。
  • ノイズ統計を考慮した新たな初期化戦略を導出し、深層ネットワークにおける信号安定性を維持すること。
  • ノイズが、臨界初期化下でも入力の識別的情報をどれだけの深さまで伝播させられるかに与える影響を分析すること。

提案手法

  • 加法的および乗法的ガウスノイズ、ドロップアウトを含むさまざまなノイズ分布を含めた信号伝播の平均場理論を拡張する。
  • ノイズを含む確率的初期化された深層 ReLU ネットワークにおける前活性化分散および入力相関ダイナミクスの再帰的式を導出する。
  • 乗法的ノイズの第二モーメントに依存する一般化された臨界初期化条件を導入する。
  • 理論を用いて、ノイズによって入力表現が均一に相関するようになるまでの最大トレーニング可能深さを予測する。
  • MNIST および CIFAR-10 での数値シミュレーションと実験を通じて理論的予測を検証し、ドロップアウト率やノイズレベルを変化させた条件で評価する。
  • 入力間の相関ダイナミクスを深さの関数として分析し、ノイズ下での識別的情報の喪失を定量的に評価する。

実験結果

リサーチクエスチョン

  • RQ1確率的正則化が適用された深層 ReLU ネットワークに対して、臨界初期化戦略を導出できるか?
  • RQ2加法的ノイズでは、信号伝播を安定化させるあらゆる臨界初期化が存在しないのか?
  • RQ3乗法的ノイズの場合、ノイズ分布の第二モーメントは、必要な重み初期化分散にどのように影響するか?
  • RQ4臨界初期化下のノイズあり ReLU ネットワークでは、入力の識別的情報はどの深さまで伝播可能か?
  • RQ5ノイズ正則化を強化すると、臨界初期化されたネットワークの有効なトレーニング可能深さはどのように変化するか?

主な発見

  • 任意のゼロ平均加法的ノイズでは、ノイズ分布にかかわらず信号伝播が常に発散するため、臨界初期化は存在しない。
  • 乗法的ノイズ(例:ドロップアウト)では、臨界初期化が可能であり、ノイズ分布の第二モーメントに依存し、条件として σ²_w = 2/μ₂ が得られる。
  • 理論的予測は、シミュレーションおよび MNIST と CIFAR-10 における実世界の実験と一致し、導出された初期化を用いることで信号伝播が安定することが確認された。
  • 臨界状態であっても、ノイズ正則化を強化すると、異なる入力の表現間の相関が増大するため、入力の識別性が保持できる深さが減少する。
  • ドロップアウト率 p=0.5 は、Xavier 初期化(σ²_w = 1)に対応し、実験的成績と整合しており、実用的有効性を説明する。
  • 理論的深さ限界(6ξ_c)は、検証損失が劣化し始める点をよく追跡しており、ノイズ下でのトレーニング可能深さの実用的上限を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。