Skip to main content
QUICK REVIEW

[論文レビュー] Luck Matters: Understanding Training Dynamics of Deep ReLU Networks

Yuandong Tian, Tina Jiang|arXiv (Cornell University)|May 31, 2019
Generative Adversarial Networks and Image Synthesis参考文献 41被引用数 14
ひとこと要約

本稿では、深層ReLUネットワークの学習ダイナミクスを説明する理論的枠組みを、教師-生徒設定を用いて提案する。初期重みの重なりが大きい生徒ノードは教師ノードに速やかに収束する一方、関連のないノードの出力重みはゼロに収縮する。これにより、過パラメータ化、implicit regularization、ランダムチケットの現象が『運の良さ』のある初期化とウィナーテイクアールダイナミクスによって統一的に説明される。

ABSTRACT

We analyze the dynamics of training deep ReLU networks and their implications on generalization capability. Using a teacher-student setting, we discovered a novel relationship between the gradient received by hidden student nodes and the activations of teacher nodes for deep ReLU networks. With this relationship and the assumption of small overlapping teacher node activations, we prove that (1) student nodes whose weights are initialized to be close to teacher nodes converge to them at a faster rate, and (2) in over-parameterized regimes and 2-layer case, while a small set of lucky nodes do converge to the teacher nodes, the fan-out weights of other nodes converge to zero. This framework provides insight into multiple puzzling phenomena in deep learning like over-parameterization, implicit regularization, lottery tickets, etc. We verify our assumption by showing that the majority of BatchNorm biases of pre-trained VGG11/16 models are negative. Experiments on (1) random deep teacher networks with Gaussian inputs, (2) teacher network pre-trained on CIFAR-10 and (3) extensive ablation studies validate our multiple theoretical predictions.

研究の動機と目的

  • 非凸な深層学習問題において、確率的勾配降下法(SGD)が良い解を見つける理由を理解すること。
  • 過パラメータ化された深層ReLUネットワークの一般化能力を説明すること。
  • 過パラメータ化、implicit regularization、ランダムチケットといった奇妙な現象を統一的に説明すること。
  • 初期化の重なり度合いと生徒ノードの収束速度・重み減衰の関係を理論的に結びつける枠組みを提供すること。

提案手法

  • 固定されたReLU教師ネットワークに対して過パラメータ化された生徒ネットワークを用いた教師-生徒学習設定を採用する。
  • ノードの活性化領域を E_j = {x : f_j(x) > 0} と定義し、生徒ノードから教師ノードへの勾配フローを分析する。
  • 初期重なり度が大きい(活性化領域の重なりが大きい)生徒ノードは教師ノードに速やかに収束することを証明する(定理4)。
  • 2層ネットワークにおいて、教師ノードと重なりのない生徒ノードの出力重みはゼロに減少し、ウィナーテイクアール行動が生じることを示す(定理5)。
  • 勾配信号の伝搬と最適化中の安定化をモデル化するため、上向きモード(β)とヘッセ行列解析を用いる。
  • ランダムなガウス入力、CIFAR-10、バッチノーマライゼーションと過パラメータ化のアブレーションスタディを用いた実験により、理論的予測の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1過パラメータ化されたReLUネットワークは、高い容量を持つにもかかわらず、なぜ一般化性能が良いのか?
  • RQ2学習中に、生徒ノードの勾配フローは、教師ノードとの重なり度にどのように依存するか?
  • RQ3学習済みReLUネットワークにランダムチケットが存在する理由は何か?
  • RQ4なぜSGDで訓練された深層ネットワークに平坦な最小値が出現するのか?
  • RQ5バッチノーマライゼーションは、生徒ネットワークの収束速度とノード類似度にどのように影響するか?

主な発見

  • 初期重なり度が高い生徒ノードは、定理4で示されるように、教師ノードに著しく速やかに収束する。
  • 2層の過パラメータ化ReLUネットワークでは、教師ノードと重なりのない生徒ノードの出力重みがゼロに減少し、ウィナーテイクアール行動が生じる(定理5)。
  • ガウス入力に対する実験では、ノード類似度(ρ)が学習中に増加し、特に深層部で収束が速くなることが確認され、バッチノーマライゼーションにより性能が向上する。
  • CIFAR-10では、生徒ネットワークが教師より約1%高いテスト精度を達成し、バッチノーマライゼーションが収束を加速させるとともにノードランク相関を向上させる。
  • アブレーションスタディにより、過パラメータ化がρの収束を安定化・加速することが確認された一方、有限データでは活性化領域のスパarsityにより類似度の増加が止まる。
  • H* および β* 行列の可視化により、高相関の生徒ノードが最適化後に強い上向きモードと教師ノードと整合する活性化パターンを発達することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。