Skip to main content
QUICK REVIEW

[論文レビュー] An Improved Analysis of Training Over-parameterized Deep Neural Networks

Difan Zou, Quanquan Gu|arXiv (Cornell University)|Jun 11, 2019
Stochastic Gradient Optimization Techniques参考文献 25被引用数 47
ひとこと要約

この論文は、深い ReLU ネットワークの GD/SGD 学習における過parameterizationの条件を緩和し、収束速度を高める新しい境界を提供します。特に二層ネットワークに対する従来境界を上回る改善があります。

ABSTRACT

A recent line of research has shown that gradient-based algorithms with random initialization can converge to the global minima of the training loss for over-parameterized (i.e., sufficiently wide) deep neural networks. However, the condition on the width of the neural network to ensure the global convergence is very stringent, which is often a high-degree polynomial in the training sample size $n$ (e.g., $O(n^{24})$). In this paper, we provide an improved analysis of the global convergence of (stochastic) gradient descent for training deep neural networks, which only requires a milder over-parameterization condition than previous work in terms of the training sample size and other problem-dependent parameters. The main technical contributions of our analysis include (a) a tighter gradient lower bound that leads to a faster convergence of the algorithm, and (b) a sharper characterization of the trajectory length of the algorithm. By specializing our result to two-layer (i.e., one-hidden-layer) neural networks, it also provides a milder over-parameterization condition than the best-known result in prior work.

研究の動機と目的

  • なぜ過剰パラメータ化が深い ReLU ネットワークの勾配法ベースの訓練におけるグローバル収束を可能にするのかを動機づける。
  • より速い収束速さを達成するための勾配下限界をより厳密に導出する。
  • 最適化ダイナミクスをよりよく特徴づけるために軌道長の解析を鋭化する。
  • 二層ネットワークへ結果を特化し、従来の研究と直接比較する。
  • 結果をSGDへ拡張し、既存のGD/SGD保証と対比する。

提案手法

  • 全層でガウス乱数初期化を用いた訓練を分析する。
  • 層の出力とほぼ直交する勾配領域を導入することにより勾配下限を確立する。
  • 望遠鏡和を用いた議論を可能にするため、より鋭い軌道長の境界を証明する。
  • 目標精度 ε 内の収束を保証するような幅 m の条件を導く。
  • 一般結果を二層ネットワークへ特化し、従来の研究と直接比較する。
  • 対応する過パラメータ化と反復境界を伴うSGDへの拡張を提供する。

実験結果

リサーチクエスチョン

  • RQ1どのようなより緩い過パラメータ化条件の下で、GD/SGD は深い ReLU ネットワークに対して ε-訓練損失を達成できるか?
  • RQ2より厳密な勾配下限と軌道長解析は、従来の結果と比較して反復複雑性にどう影響するか?
  • RQ3二層 ReLU ネットワークとより深いアーキテクチャとの比較におくこれらの結果の意味は何か?
  • RQ4結果はSGDや平方損失以外の他の損失関数にも拡張できるか?

主な発見

  • GD は各層あたり m = Ω(kn^8 L^12 φ^{-4} log^3(m)) 個の隠れノードの下で、O(n^2 L^2 log(1/ε)/φ) 回の反復で ε-訓練損失を達成する。
  • SGD は、m = Ω(kn^{17} L^{12} log^3(m) B^{-4} φ^{-8}) の下で、O(n^5 log(m) log^2(1/ε)/(Bφ^2)) 回の反復で期待値 ε の訓練損失を達成する。
  • 二層ネットワークでは、GD は O(n^2 log(1/ε)/φ) 回の反復で ε-訓練損失を達成し、m = Ω(kn^8 log^3(m)/φ^4) が必要。
  • 過パラメータ化条件は、従来の研究に対して、それぞれの設定で少なくとも n^4/φ および n^7 B^5 の因子だけ改善される。
  • 分析は勾配領域を導入してより厳密な勾配下限を得ることで、収束速度を改善する。
  • 軌道長解析はより厳密な境界をもたらし、問題パラメータへの依存をより有利にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。