Skip to main content
QUICK REVIEW

[論文レビュー] Convergence rates for gradient descent in the training of overparameterized artificial neural networks with biases

Arnulf Jentzen, Timo Kröger|arXiv (Cornell University)|Feb 23, 2021
Machine Learning and ELM被引用数 4
ひとこと要約

この論文は、バイアス付きの過パラメータ化された全結合ReLUニューラルネットワークにおけるバッチ勾配降下法の線形収束レートを確立している。十分な幅、小さな学習率、および線形独立な入力データの条件下で、訓練誤差が指数関数的に速く減少することを示している。解析により、平均二乗誤差が線形レートでゼロに収束することが証明され、過パラメータ化された設定における勾配降下法の実験的成功さに理論的裏付けが与えられる。

ABSTRACT

In recent years, artificial neural networks have developed into a powerful tool for dealing with a multitude of problems for which classical solution approaches reach their limits. However, it is still unclear why randomly initialized gradient descent optimization algorithms, such as the well-known batch gradient descent, are able to achieve zero training loss in many situations even though the objective function is non-convex and non-smooth. One of the most promising approaches to solving this problem in the field of supervised learning is the analysis of gradient descent optimization in the so-called overparameterized regime. In this article we provide a further contribution to this area of research by considering overparameterized fully-connected rectified artificial neural networks with biases. Specifically, we show that for a fixed number of training data the mean squared error using batch gradient descent optimization applied to such a randomly initialized artificial neural network converges to zero at a linear convergence rate as long as the width of the artificial neural network is large enough, the learning rate is small enough, and the training input data are pairwise linearly independent.

研究の動機と目的

  • 非凸的で非滑らかな損失関数の下でも、過パラメータ化されたニューラルネットワークにおいて勾配降下法がゼロの訓練誤差を達成する理由を説明すること。
  • 従来の収束結果を拡張し、全結合ReLUネットワークにバイアスを組み込むこと。
  • この過パラメータ化された状態におけるバッチ勾配降下法の定量的収束レートを確立すること。
  • ランダム初期化、ネットワークの幅、入力データ構造が収束を保証する役割を分析すること。

提案手法

  • ランダム重み初期化を用いて、過パラメータ化された全結合ReLUネットワークにおけるバッチ勾配降下法を分析する。
  • 訓練中のネットワークパラメータに関する経験的リスクの勾配の正確な式を導出する。
  • 訓練ダイナミクスと初期化時のネットワーク特徴マップのグラム行列との間の関係を確立する。
  • 濃度不等式と部分指数的尾部バウンドを用いて、最適化中における確率的グラム行列を制御する。
  • 十分な幅と小さな学習率の下で、経験的リスクが線形レートで減少することを証明する。
  • 勾配フローの極限が、ネットワークの特徴マップとReLU活性化関数に支配される線形系に対応することを示す。

実験結果

リサーチクエスチョン

  • RQ1バッチ勾配降下法が過パラメータ化されたReLUネットワーク(バイアス付き)で線形収束を達成する条件は何か?
  • RQ2バイアスの組み込みが、過パラメータ化された設定における勾配降下法の収束行動に与える影響は何か?
  • RQ3訓練データの線形独立性がゼロの訓練誤差への収束を保証するために果たす役割は何か?
  • RQ4ネットワークの幅と学習率が、共同して収束レートに与える影響は何か?
  • RQ5過パラメータ化された状態において、勾配降下法のダイナミクスは極限線形系によって特徴付けられるか?

主な発見

  • ネットワークの幅が十分に大きい限り、訓練ステップ数が増加するにつれて平均二乗誤差が線形レートでゼロに収束する。
  • 学習率が十分に小さく、入力データがペアワイズに線形独立である限り、収束が保証される。
  • 勾配フローの極限は、ネットワーク出力が入力とネットワークの隠れ層重みの内積によって決定される線形系に対応する。
  • 収束レートは (1 - ηΛ)^n で有界であり、ここで Λ は決定的グラム行列の最小固有値に関連する正の定数である。
  • 高確率(少なくとも 1 - ε)で、経験的リスクは時間とともに指数関数的に速く減少する。
  • 解析により、バイアスの存在が収束を妨げず、訓練中にネットワークの特徴マップが良好に条件付けられていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。