Skip to main content
QUICK REVIEW

[論文レビュー] Implicit Bias of Gradient Descent for Two-layer ReLU and Leaky ReLU Networks on Nearly-orthogonal Data

Yiwen Kou, Zixiang Chen|arXiv (Cornell University)|Oct 29, 2023
Machine Learning and ELM被引用数 4
ひとこと要約

本稿は、ほぼ直交するデータにおける2層ReLUおよびLeaky ReLUネットワークにおける勾配降下法の暗黙的バイアスを確立し、Leaky ReLUでは安定ランク1への収束、ReLUでは有界な安定ランクへの収束を証明している。また、すべての訓練例が漸近的に同じ正規化マージンに達することを示している。解析により、対数的重みノルムの増加と$ Theta(t^{-1})$の損失収束が明らかとなり、非滑らかネットワークにおける勾配降下法への先行の勾配フロー結果の拡張がなされた。

ABSTRACT

The implicit bias towards solutions with favorable properties is believed to be a key reason why neural networks trained by gradient-based optimization can generalize well. While the implicit bias of gradient flow has been widely studied for homogeneous neural networks (including ReLU and leaky ReLU networks), the implicit bias of gradient descent is currently only understood for smooth neural networks. Therefore, implicit bias in non-smooth neural networks trained by gradient descent remains an open question. In this paper, we aim to answer this question by studying the implicit bias of gradient descent for training two-layer fully connected (leaky) ReLU neural networks. We showed that when the training data are nearly-orthogonal, for leaky ReLU activation function, gradient descent will find a network with a stable rank that converges to $1$, whereas for ReLU activation function, gradient descent will find a neural network with a stable rank that is upper bounded by a constant. Additionally, we show that gradient descent will find a neural network such that all the training data points have the same normalized margin asymptotically. Experiments on both synthetic and real data backup our theoretical findings.

研究の動機と目的

  • 非滑らかなニューラルネットワーク、特にReLUおよびLeaky ReLUネットワークにおける勾配降下法の暗黙的バイアスを理解すること。このバイアスは依然として十分に理解されていない。
  • 訓練データがほぼ直交する場合に、勾配降下法が2層全結合ネットワークをどのように最適化するかを分析すること。この条件は理論的取り扱いの容易さを可能にする。
  • ReLUおよびLeaky ReLU活性化関数における勾配降下法の下で、重み行列の収束特性(安定ランクおよび正規化マージンを含む)を確立すること。
  • 同様の設定において、先行の勾配フロー結果を勾配降下法へと拡張し、特に非滑らか設定において厳密な理論的保証を提供すること。

提案手法

  • ほぼ直交するデータ($\|\mathbf{x}_i\|_2^2 \geq Cn \max_{k \neq i} |\langle \mathbf{x}_i, \mathbf{x}_k \rangle|$)を前提とした2層ReLUおよびLeaky ReLUネットワークにおける勾配降下法のダイナミクスの理論的分析。
  • ニューロンの活性化パターンと重み行列の進化の分析を通じて、Leaky ReLUネットワークでは安定ランクが1に収束し、ReLUネットワークでは有界な安定ランクに収束することの証明。
  • 微分不等式技術と対数積分を用いて、重みノルムの増加率が$\Theta(\log t)$、損失の減少率が$\Theta(t^{-1})$であることを導出。
  • 損失関数および勾配ダイナミクスの性質を活用し、すべての訓練データポイントが漸近的に同じ正規化マージンに達することの証明。
  • 収束解析における主要な項のバウンディングに、サブガウス型行列集中(補題H.3)および対数不等式補題(H.4, H.5)の使用。
  • 対数的重みノルムの増加を制御し、収束速度を導出するために微分不等式技術(補題H.1およびH.2)の適用。

実験結果

リサーチクエスチョン

  • RQ1ほぼ直交するデータで訓練された2層ReLUおよびLeaky ReLUネットワークにおける勾配降下法の暗黙的バイアスは何か?
  • RQ2ReLUおよびLeaky ReLUネットワークにおける勾配降下法の下で、重み行列の安定ランクはどのように変化するか?
  • RQ3勾配降下法は、これらのネットワークにおいて、すべての訓練サンプルを漸近的に同じ正規化マージンに導くか?
  • RQ4これらの非滑らかネットワークにおける勾配降下法の下で、重みノルムおよび訓練損失の収束速度は何か?
  • RQ5勾配降下法の理論的結果は、同じ設定における先行の勾配フロー解析とどのように比較できるか?

主な発見

  • 2層Leaky ReLUネットワークでは、勾配降下法が重み行列の安定ランクを1に収束させる。これはFreiら(2022b)の勾配フロー結果と一致する。
  • 2層ReLUネットワークでは、重み行列の安定ランクが定数で上界を持つ。完全に直交するデータの下で、収束が約2に達する具体例が示されている。
  • 勾配降下法は、反復回数$t$に対して$\Theta(\log t)$の速度で重みノルムを増加させる。
  • 訓練損失は$\Theta(t^{-1})$の速度で0に収束し、滑らかにしたネットワークにおける先行研究の$O(t^{-1/2})$の速度を改善している。
  • すべての訓練データポイントが漸近的に同じ正規化マージンに達する。これは最大マージン解への収束を示唆している。
  • 理論的結果は、合成データおよび実世界のデータセットにおいて実験的に検証され、予測された収束行動が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。