Skip to main content
QUICK REVIEW

[論文レビュー] Avoiding Spurious Local Minima in Deep Quadratic Networks

Abbas Kazemipour, Brett W. Larsen|arXiv (Cornell University)|Dec 31, 2019
Stochastic Gradient Optimization Techniques参考文献 38被引用数 4
ひとこと要約

この論文は、過パラメータ化された深層2次ニューラルネットワークが、損失関数の曲面において偽の局所的最小値を回避することを確立し、弱い条件下でも勾配降下法が確率1でグローバル最小値に収束することを証明している。入力のノルムを回帰変数として追加する、または構造的正則化を用いることで、2層ネットワークでさえも、d次元の入力に対してd個のニューロンしか持たない場合でも、偽の停留点からの脱出が可能であることが示された。

ABSTRACT

Despite their practical success, a theoretical understanding of the loss landscape of neural networks has proven challenging due to the high-dimensional, non-convex, and highly nonlinear structure of such models. In this paper, we characterize the training landscape of the mean squared error loss for neural networks with quadratic activation functions. We prove existence of spurious local minima and saddle points which can be escaped easily with probability one when the number of neurons is greater than or equal to the input dimension and the norm of the training samples is used as a regressor. We prove that deep overparameterized neural networks with quadratic activations benefit from similar nice landscape properties. Our theoretical results are independent of data distribution and fill the existing gap in theory for two-layer quadratic neural networks. Finally, we empirically demonstrate convergence to a global minimum for these problems.

研究の動機と目的

  • 平均二乗誤差損失関数を用いた深層2次ニューラルネットワークの損失関数の曲面を理論的に特徴づけること。
  • 既存理論のギャップを埋めるために、データ分布に依存せず、k ≥ d 個のニューロンを持つ2層2次ネットワークについてグローバル収束を証明すること。
  • 過パラメータ化と特定の正則化戦略が、偽の局所的最小値および鞍点を排除することを示すこと。
  • 勾配降下法が、高次元かつ非凸な設定下でもグローバル最小解に収束する条件を確立すること。

提案手法

  • ReLUに類似した2次活性化関数を用いた2層および深層2次ニューラルネットワークにおける平均二乗誤差損失関数を分析する。
  • 入力サンプルのL2ノルムを明示的な回帰変数として追加することで、データ正規化を導入し、偽の局所的最小値からの脱出を可能にする。
  • 因子分解行列に対するフロベニウスノルムペナルティを用いて正則化を施し、フルランク解を強制し、低ランクの罠を避ける。
  • 固有値分解およびテンソル分解理論を用いて、フルランク条件のもとで最適化問題を重み空間において凸問題に再定式化する。
  • 任意のステップサイズを用いた勾配降下法を適用し、ネットワークが過パラメータ化されており適切に初期化されている場合、グローバル最小値に収束することを証明する。
  • k = binom(d+p-1, d-1) 個のニューロンと適切な初期化のもとで、高次多項式ネットワーク(PLネットワーク)に対しても結果を一般化する。

実験結果

リサーチクエスチョン

  • RQ12層2次ニューラルネットワークが、損失関数の曲面においてどのような条件下で偽の局所的最小値を回避するのか?
  • RQ2ニューロン数が入力次元と等しい場合(k = d)でも、勾配降下法が2次ネットワークでグローバル最小値に収束できるか?
  • RQ3特に、入力ノルムを回帰変数として追加することによるデータ正規化は、偽の停留点からの脱出にどのように寄与するか?
  • RQ4対称行列因子分解における2次ネットワークの偽の解を排除する正則化の役割は何か?
  • RQ5過パラメータ化された深層2次ネットワークは、2層ネットワークの良好な最適化特性を引き継ぐのか?

主な発見

  • k ≥ d 個のニューロンを持つ2層2次ネットワークでは、入力ノルムを回帰変数として用いることで、勾配降下法が偽の局所的最小値および鞍点を確率1で回避する。
  • 理論的結果はデータ分布に依存せず、先行研究に見られる制限的な仮定を排除する。
  • 過パラメータ化された深層2次ネットワークは偽の停留点を有さず、勾配降下法によるグローバル収束が可能である。
  • k = d の場合、学習は2次特徴を用いた最小二乗問題に帰着され、固有値分解により解ける。
  • 高次多項式ネットワーク(p > 2)では、k = binom(d+p-1, d-1) 個のニューロンと適切な初期化のもとでグローバル収束が保証される。
  • 分析で用いられた正則化ペナルティは、フルランク因子分解を保証し、偽の最小値に至る可能性のある低ランク解を回避する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。