Skip to main content
QUICK REVIEW

[論文レビュー] Collapse of Deep and Narrow Neural Nets

Lu Lu, Yanhui Su|arXiv (Cornell University)|Aug 15, 2018
Model Reduction and Neural Networks参考文献 46被引用数 11
ひとこと要約

この論文は、対称重み初期化を施した深く狭いReLUニューラルネットワークが、最適化手法や損失関数にかかわらず、訓練中に誤った目標関数の平均値または中央値に収束する傾向があることを示している。この崩壊は、狭いアーキテクチャにおける勾配消失に起因し、バッチ正規化やSELUを用いることで緩和可能であるが、重み正規化やドロップアウトではそれを防げない。

ABSTRACT

Recent theoretical work has demonstrated that deep neural networks have superior performance over shallow networks, but their training is more difficult, e.g., they suffer from the vanishing gradient problem. This problem can be typically resolved by the rectified linear unit (ReLU) activation. However, here we show that even for such activation, deep and narrow neural networks (NNs) will converge to erroneous mean or median states of the target function depending on the loss with high probability. Deep and narrow NNs are encountered in solving partial differential equations with high-order derivatives. We demonstrate this collapse of such NNs both numerically and theoretically, and provide estimates of the probability of collapse. We also construct a diagram of a safe region for designing NNs that avoid the collapse to erroneous states. Finally, we examine different ways of initialization and normalization that may avoid the collapse problem. Asymmetric initializations may reduce the probability of collapse but do not totally eliminate it.

研究の動機と目的

  • 理論的な利点があるにもかかわらず、深く狭いニューラルネットワークが複雑な関数を学習できない理由を調査すること。
  • ReLU活性化関数と対称初期化を用いた狭いネットワークにおける学習崩壊の根本的要因を特定すること。
  • このようなネットワークが損失関数に応じて定数出力(平均または中央値)に収束することを理論的および数値的証拠で示すこと。
  • アーキテクチャ的および正規化技術を用いて、深く狭いネットワークにおける崩壊を回避する実用的な設計指針を策定すること。
  • 崩壊を防ぐために、さまざまな初期化および正規化手法の有効性を評価すること。

提案手法

  • 理論的分析により、ネットワークが定数関数になると、すべての前の層の勾配が消失し、定数出力に収束することを証明した。
  • 補題および定理を用いて、崩壊確率を導出し、深さおよび狭さが増すほどその確率が上昇することを示した。特に幅2のネットワークで顕著である。
  • 数値実験では、MSEおよびMAE損失関数下でのC⁰、C∞、およびL²正則性を持つ1次元および2次元関数を用いて検証した。
  • 正規化手法として、バッチ正規化(BN)、重み正規化(WN)、SELU、ドロップアウトを評価し、直交初期化およびLSUVを含む対称・非対称重み初期化を比較した。
  • 理論的崩壊確率推定に基づき、安全領域図を構築し、ネットワーク設計を支援する。
  • 収束先が正しい関数値か、誤った平均/中央値状態かを測定することで、正規化手法の有効性を評価した。

実験結果

リサーチクエスチョン

  • RQ1深く狭いReLUネットワークは、理論的には複雑な関数を近似可能であるにもかかわらず、なぜ学習に失敗するのか?
  • RQ2訓練中にネットワークが目標関数の平均値または中央値に収束する原因は何か?
  • RQ3対称重み初期化が狭いネットワークにおける崩壊現象にどのように寄与するのか?
  • RQ4バッチ正規化やSELUといった正規化手法は、深く狭いネットワークにおける崩壊を防げるか?
  • RQ5理論的崩壊確率は何か?また、異なるネットワーク幅および深さに対してどのように推定できるか?

主な発見

  • 対称初期化を施した深く狭いReLUネットワークは、最適化手法や学習期間にかかわらず、目標関数の平均(MSE損失時)または中央値(MAE損失時)に収束する。
  • 理論的分析により、ネットワークが定数関数になると、すべての重みおよびバイアスの勾配が消失し、定数出力に収束することが示された。
  • 幅2のネットワークでは、深さLおよび入力次元dに対して、崩壊確率が1 - (1 - 2^{-d})^{L}と推定され、深く狭い設定では高いリスクを示す。
  • バッチ正規化とSELUは、非ゼロの勾配を維持し、飽和を回避することで、崩壊を効果的に防止した。一方、重み正規化は再パrameterization不変性のため失敗した。
  • ドロップアウトは崩壊を防げず、スパarsityを増加させ、ゼロ活性化を強化することで、狭いアーキテクチャにおいて問題を悪化させた。
  • 安全領域図を構築し、崩壊リスクを最小限に抑える幅・深さの組み合わせを特定することで、深く狭いネットワークの設計を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。