Skip to main content
QUICK REVIEW

[論文レビュー] Deep Residual Networks and Weight Initialization

Masato Taki|arXiv (Cornell University)|Sep 9, 2017
Advanced Neural Network Applications参考文献 15被引用数 13
ひとこと要約

本稿では、初期重み分散への感受性を低減することで学習安定性を向上させる、深層残差ネットワーク(ResNets)のための新しい重み初期化手法を提案する。簡略化されたResNetモデルの分析を通じて、残差接続が勾配消失/爆発問題を本質的に軽減することを示し、追加の計算コストなしにバッチ正規化と同等の性能を示す、特に初期学習段階において顕著である。

ABSTRACT

Residual Network (ResNet) is the state-of-the-art architecture that realizes successful training of really deep neural network. It is also known that good weight initialization of neural network avoids problem of vanishing/exploding gradients. In this paper, simplified models of ResNets are analyzed. We argue that goodness of ResNet is correlated with the fact that ResNets are relatively insensitive to choice of initial weights. We also demonstrate how batch normalization improves backpropagation of deep ResNets without tuning initial values of weights.

研究の動機と目的

  • なぜResNetsが標準的な深層ネットワークよりも重み初期化に対してより頑健であるかを理解すること。
  • 残差接続が深層ネットワークにおける勾配の流れと信号伝播に与える影響を分析すること。
  • バッチ正規化を用いない深層ResNetsにおける学習安定性を向上させる新しい重み初期化手法を開発すること。
  • 提案手法の有効性を、初期学習段階においてヘの初期化とバッチ正規化と比較すること。
  • 極めて深いResNetsにおける勾配爆発の理論的限界を調査すること、すなわちバッチ正規化が適用された場合でさえも。

提案手法

  • i.i.d.かつ対称的な重み分布を仮定した、$\boldsymbol{z}^{\ell} = f(\boldsymbol{W}^{\ell}\boldsymbol{z}^{\ell-1}) + \boldsymbol{z}^{\ell-1}$ で定義される簡略化されたResNetモデルを分析する。
  • 層出力および勾配の分散伝播式を導出し、ResNetsが勾配の線形的増加 $\mathrm{Var}\left[\frac{\partial E}{\partial w^{\ell}}\right] \propto \frac{L}{\ell}$ を示すのに対し、通常のネットワークでは指数的増加を示すことを示す。
  • 初期重みの分散を $\mathrm{Var}[w] = \frac{c}{nL}$ と制御することで学習を安定化させる、新しい初期化ルール(式28)を提案、ここで $n$ はファンイン、$L$ は深さである。
  • 理論的分析にバッチ正規化を組み込み、勾配爆発を線形的増加にまで軽減することを示すが、極めて深いネットワークでは依然として深刻な勾配爆発を引き起こすことを示す。
  • CIFAR-10を用いた実験的評価を通し、100層のResNetsにおいて、提案手法とヘの初期化、バッチ正規化を比較する。
  • 分散伝播および誤差逆伝播解析を用いて、層間における勾配の挙動と信号の安定性を定量化する。

実験結果

リサーチクエスチョン

  • RQ1なぜResNetsは標準的な深層ネットワークよりも重み初期化に対して感受性が低いのか?
  • RQ2残差接続構造は深層ネットワークにおける勾配の流れと信号伝播にどのように影響するのか?
  • RQ3単純な重み初期化ルールが、バッチ正規化と同等の学習安定性を深層ResNetsで達成できるか?
  • RQ4極めて深いResNetsにおいて、バッチ正規化が適用された場合でも、勾配爆発の理論的限界は何か?
  • RQ5提案手法は、初期学習段階における安定性と収束性の観点から、ヘの初期化と比べてどのように優れているか?

主な発見

  • 提案された重み初期化は、バッチ正規化と同等の初期学習段階の安定性を達成し、CIFAR-10で1エポック後における平均検証正答率が0.434、標準偏差が0.017を示した。
  • ResNetsは、順伝播および逆伝播において信号の大きさを保持する残差スキップ接続のおかげで、通常のネットワークよりも重み初期化に対して本質的に感受性が低い。
  • 深層ResNetsにおける勾配分散は深さに比例して線形的に増加する($\mathrm{Var}\left[\frac{\partial E}{\partial w^{\ell}}\right] \propto \frac{L}{\ell}$)、これは通常のネットワークで見られる指数的増加と比べてはるかに安定している。
  • バッチ正規化は勾配爆発を線形的増加まで軽減するが、極めて深いネットワーク($L \gg 1$)では依然として深刻な勾配爆発を引き起こし、特に初期層で顕著である。
  • 提案手法により、初期学習段階においてバッチ正規化の必要性を回避でき、最小限の計算コストで軽量な代替手段を提供する。
  • バッチ正規化が適用された場合でも、極めて深いResNetsは残差勾配の増加に起因する理論的限界に直面しており、極度の深さでは初期化のみでは問題を完全に解決できないことが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。