Skip to main content
QUICK REVIEW

[論文レビュー] Gradient Descent for One-Hidden-Layer Neural Networks: Polynomial Convergence and SQ Lower Bounds

Santosh Vempala, John Wilmes|arXiv (Cornell University)|May 7, 2018
Stochastic Gradient Optimization Techniques参考文献 29被引用数 6
ひとこと要約

本稿は、ReLU もしくはシグモイド活性化関数を用いた1層隠れ層ニューラルネットワークの学習における勾配降下法の多項式時間収束保証を確立する。勾配降下法は、$n^{O(k)}\log(1/\varepsilon)$ 個のユニットと反復回数を用いて、最良の次数$k$の多項式近似を誤差 $\varepsilon_0 + \varepsilon$ で近似する。また、統計的クエリ(SQ)下界をほぼ一致させる結果を示し、任意のSQアルゴリズムがこの問題の複雑さを著しく上回ることはできないことを示しており、したがって、アグノスティックな学習設定において勾配降下法の最適性を示している。

ABSTRACT

We study the complexity of training neural network models with one hidden nonlinear activation layer and an output weighted sum layer. We analyze Gradient Descent applied to learning a bounded target function on $n$ real-valued inputs. We give an agnostic learning guarantee for GD: starting from a randomly initialized network, it converges in mean squared loss to the minimum error (in $2$-norm) of the best approximation of the target function using a polynomial of degree at most $k$. Moreover, for any $k$, the size of the network and number of iterations needed are both bounded by $n^{O(k)}\log(1/ε)$. In particular, this applies to training networks of unbiased sigmoids and ReLUs. We also rigorously explain the empirical finding that gradient descent discovers lower frequency Fourier components before higher frequency components. We complement this result with nearly matching lower bounds in the Statistical Query model. GD fits well in the SQ framework since each training step is determined by an expectation over the input distribution. We show that any SQ algorithm that achieves significant improvement over a constant function with queries of tolerance some inverse polynomial in the input dimensionality $n$ must use $n^{Ω(k)}$ queries even when the target functions are restricted to a set of $n^{O(k)}$ degree-$k$ polynomials, and the input distribution is uniform over the unit sphere; for this class the information-theoretic lower bound is only $Θ(k \log n)$. Our approach for both parts is based on spherical harmonics. We view gradient descent as an operator on the space of functions, and study its dynamics. An essential tool is the Funk-Hecke theorem, which explains the eigenfunctions of this operator in the case of the mean squared loss.

研究の動機と目的

  • 1層隠れ層ニューラルネットワークの勾配降下法の収束を、アグノスティックな設定において厳密に分析すること。
  • 勾配降下法の経験的スペクトルバイアス(低周波数のフーリエ成分が高周波数のものよりも先に学習される現象)を、理論的枠組みで説明すること。
  • 統計的クエリ(SQ)モデルにおいて、次数$k$の多項式近似を学習する際の、勾配降下法の複雑さを上回る可能性が全くない、ほぼタイトな下界を確立すること。
  • 球面調和関数とファンク=フェッケの定理を用いて、勾配降下法とSQ複雑さの分析を統一し、ネットワーク学習ダイナミクスの関数解析的視点を提供すること。

提案手法

  • 球面調和関数とファンク=フェッケの定理を用いて、勾配降下法を関数空間上の線形作用素としてモデル化し、最適化ダイナミクスのスペクトル分解を可能にする。
  • 主要な存在定理を証明:有界関数で、次数$k$の多項式近似誤差が$\varepsilon_0$であるものについて、任意の活性化関数クラスにおいて次数$k$までの非ゼロの調和係数を持つ限り、ランダムに選ばれた$n^{O(k)} \cdot \text{poly}(1/\varepsilon)$ 個のゲートを用いて、$\varepsilon_0 + \varepsilon$ の誤差で近似可能である。
  • 本手法はReLUおよびシグモイド活性化関数の両方に対応可能であり、両者ともに必要な次数において非ゼロの調和係数を持つため。
  • 収束保証は、勾配降下法が、凸性やグローバル収束性がなくても、次数$k$の多項式による最良の$L^2$近似にネットワーク出力を近づけることを示すことによって得られる。
  • SQモデルにおける下界は、ガウスノイズを伴うクエリへの還元と、ノイズ付きクエリのリプシッツ性を活用することで確立される。
  • SQ下界はほぼタイトであることが示され、定数誤差を達成する任意のアルゴリズムは、$n^{\Omega(k)}$ 個のクエリを必要とし、上界と対数的要因を除いて一致する。

実験結果

リサーチクエスチョン

  • RQ1勾配降下法は、凸性がなくても、1層隠れ層ニューラルネットワークにおいて、最良の次数$k$の多項式近似に、保証された収束を示せるか?
  • RQ2なぜ勾配降下法は、学習中に低周波数成分を高周波数成分よりも先に学習するというスペクトルバイアスを示すのか?
  • RQ3アグノスティックな学習において、次数$k$の多項式近似を学習する際、勾配降下法はクエリ複雑度の観点で最適であると言えるか?
  • RQ4任意の有界なターゲット関数に対して、ネットワークサイズと反復回数の観点から、勾配降下法の収束を束縛できるか?
  • RQ5統計的クエリモデルに、次数$k$の多項式近似をより速く学習できないという根本的な制限があるか?

主な発見

  • 勾配降下法は、次数$k$の多項式による最良の$L^2$近似に収束し、$n^{O(k)}\log(1/\varepsilon)$ のネットワークサイズと反復回数を用いて、誤差$\varepsilon_0 + \varepsilon$を達成する。
  • 収束はアグノスティックである:ターゲット関数が多項式でなくてもよく、誤差$\varepsilon_0$で次数$k$の多項式近似が可能である限り、有効である。
  • 勾配降下法のスペクトルバイアス(低周波数フーリエ成分が先に学習される)は、球面調和関数による勾配作用素の固有構造によって、厳密に説明可能である。
  • 定数誤差を達成し、逆多項式の許容誤差を持つ任意のSQアルゴリズムは、$n^{\Omega(k)}$ 個のクエリを必要とし、ターゲットクラスが$n^{O(k)}$ 個の関数しか含まない場合でも同様である。
  • 下界は上界にほぼ一致しており、勾配降下法がこのクラスの学習問題において、SQモデルで本質的に最適であることが示されている。
  • ReLUおよびシグモイド活性化関数の両方において、次数$k$までの調和展開で非ゼロの係数を持つ限り、結果は有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。