Skip to main content
QUICK REVIEW

[論文レビュー] Implicit Bias in Leaky ReLU Networks Trained on High-Dimensional Data

Spencer Frei, Gal Vardi|arXiv (Cornell University)|Oct 13, 2022
Stochastic Gradient Optimization Techniques被引用数 5
ひとこと要約

本稿は、高次元かつほぼ直交するデータ上で学習される2層のleaky ReLUネットワークにおける勾配フローおよび勾配降下法の暗黙のバイアスを調査する。勾配フローは漸近的にランクが2以下であるネットワークを生成し、$β$-max-margin解に近似することを示している。一方、小規模な初期化を用いた勾配降下法は、訓練の全過程にわたり、重み行列の安定ランクを定数にまで急速に低下させ、低ランク構造を維持する。

ABSTRACT

The implicit biases of gradient-based optimization algorithms are conjectured to be a major factor in the success of modern deep learning. In this work, we investigate the implicit bias of gradient flow and gradient descent in two-layer fully-connected neural networks with leaky ReLU activations when the training data are nearly-orthogonal, a common property of high-dimensional data. For gradient flow, we leverage recent work on the implicit bias for homogeneous neural networks to show that asymptotically, gradient flow produces a neural network with rank at most two. Moreover, this network is an $\ell_2$-max-margin solution (in parameter space), and has a linear decision boundary that corresponds to an approximate-max-margin linear predictor. For gradient descent, provided the random initialization variance is small enough, we show that a single step of gradient descent suffices to drastically reduce the rank of the network, and that the rank remains small throughout training. We provide experiments which suggest that a small initialization scale is important for finding low-rank neural networks with gradient descent.

研究の動機と目的

  • 高次元かつほぼ直交するデータで学習される2層のleaky ReLUネットワークにおける勾配ベース最適化の暗黙のバイアスを理解すること。
  • このようなデータ条件下で勾配フローと勾配降下法がどのように低ランク解に収束するかを分析すること。
  • 初期化スケールが有限時間内での訓練におけるネットワークの安定ランクを決定する役割を調査すること。
  • 合成的高次元データおよびCIFAR-10を用いた実験を通じて理論的知見を検証し、初期化分散の影響を強調すること。

提案手法

  • 同次性ニューラルネットワークに関する最近の結果を活用し、leaky ReLUネットワークにおける勾配フローが、$β$-max-margin問題のKKT点への方向収束を示す。
  • ネットワークの複雑さの代理として、第1層重み行列 $W^{(t)}$ の安定ランクを定義する。安定ランクは $\|W^{(t)}\|_F^2 / \|W^{(t)}\|_2^2$ として定義される。
  • 小規模な初期化分散を用いた勾配降下法の1ステップ後、安定ランクが $O(\min(m,d))$ から $m$, $d$, または $n$ に依存しない絶対定数にまで低下することを証明する。
  • 勾配降下法の有限時間解析を可能にするために、leaky ReLU活性化関数の滑らか化近似を考案する。
  • SGDを用いて合成二値クラスタデータおよびCIFAR-10上で実験的に結果を検証し、標準的および小規模な初期化スケールを比較する。
  • モデルの複雑さの指標として安定ランクを用い、訓練中のその変化を追跡することで、暗黙のバイアスを評価する。

実験結果

リサーチクエスチョン

  • RQ1高次元かつほぼ直交するデータで学習される2層leaky ReLUネットワークにおける勾配フローは、低ランク解に収束するか?
  • RQ2小規模な初期化分散を用いた勾配降下法は、訓練中において重み行列の安定ランクを急速に低下させ、かつ維持できるか?
  • RQ3重み初期化のスケールが、訓練済みネットワークの安定ランクおよび一般化行動に与える影響は何か?
  • RQ4有限時間内での勾配降下法の暗黙のバイアスは、勾配フローで観察される漸近的挙動とどの程度類似しているか?
  • RQ5高次元かつほぼ直交するデータ条件下で、勾配降下法において安定ランクが有界に保たれるか?

主な発見

  • 勾配フローの場合、漸近的解のランクは2以下であり、意思決定境界において近似的な $β$-max-margin線形予測子に対応する。
  • 小規模な初期化分散を用いた勾配降下法の1ステップ後、重み行列の安定ランクは $O(\min(m,d))$ から $m$, $d$, または $n$ に依存しない絶対定数にまで低下する。
  • 訓練の全過程にわたり、小規模な初期化分散で初期化された場合、ネットワークの安定ランクは絶対定数に有界に保たれる。
  • 高次元合成データ上の実験により、小規模な初期化が安定ランクの急速な低下をもたらすことが確認され、大規模な初期化では高ランクが維持される。
  • CIFAR-10では、標準的なTensorFlow初期化では安定ランクが74以上を維持するが、分散を1/50にした場合、3.25に低下し、過学習に達すると10を超えるまで上昇する。
  • より小さい学習率では安定ランクの低下がより著しくなり、小規模な学習率で長時間訓練を続けることでさらにランクが低下する傾向がある。これはステップサイズと初期化スケールの間のトレードオフを示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。