Skip to main content
QUICK REVIEW

[論文レビュー] Can Shallow Neural Networks Beat the Curse of Dimensionality? A mean field training perspective

Stephan Wojtowytsch, E Weinan|arXiv (Cornell University)|May 21, 2020
Stochastic Gradient Optimization Techniques参考文献 29被引用数 14
ひとこと要約

この論文は、平均場訓練の下で、一般のリプシッツ連続関数を近似する際、2層ReLUニューラルネットワークは次元の呪いを克服できないことを示している。人口リスクの減少速度は $ t^{-4/(d-2)} $ より速くはならない。この結果は無限に広いネットワークに対しても成り立ち、ターゲット関数がバロン空間に属さない限り、次元が高くなると収束が著しく遅くなることを明らかにしている。

ABSTRACT

We prove that the gradient descent training of a two-layer neural network on empirical or population risk may not decrease population risk at an order faster than $t^{-4/(d-2)}$ under mean field scaling. Thus gradient descent training for fitting reasonably smooth, but truly high-dimensional data may be subject to the curse of dimensionality. We present numerical evidence that gradient descent training with general Lipschitz target functions becomes slower and slower as the dimension increases, but converges at approximately the same rate in all dimensions when the target function lies in the natural function space for two-layer ReLU networks.

研究の動機と目的

  • 平均場訓練ダイナミクスの下で、浅いニューラルネットワークが高次元関数近似において次元の呪いを克服できるかどうかを調査すること。
  • 高次元における2層ReLUネットワークの人口リスクおよび経験的リスクに対する勾配フローの収束速度を分析すること。
  • 勾配降下法の訓練が、特にターゲット関数の関数空間との関係において、どの条件下で効率的であるかを特定すること。
  • バロン空間が高次元設定における高速収束を可能にし、低速減少を回避する役割を明確にすること。

提案手法

  • 平均場スケーリング下での人口リスク関数 $ \mathcal{R}(\Theta) = \frac{1}{2}\int_{[0,1]^d} (f_\Theta - f^*)^2 \, dx $ における勾配フローのダイナミクスを分析する。
  • ネットワーク出力が $ f_\Theta(x) = \frac{1}{m}\sum_{i=1}^m a_i \sigma(w_i^T x + b_i) $ と表される平均場スケーリングを用い、パrameter空間における連続的粒子ダイナミクスを可能にする。
  • バロン空間に属さないがリプシッツ連続である反例ターゲット関数 $ f^* $ を構築し、高次元における収束の遅さを示す。
  • 人口リスクの減少速度に対する下界を導出:$ \mathcal{R}(\Theta_t) \geq t^{-4/(d-2)} $ であり、このような関数に対してはこれより速い減少は不可能であることを証明する。
  • パスノルム解析と弱収束の議論を用いて、パrameterの径方向成分の増加が遅いため、収束速度が制限されることを示す。
  • 経験的リスクおよび人口リスクの両方の訓練を通じて数値的妥当性を検証し、次元およびターゲット関数クラスごとの減少速度を比較する。

実験結果

リサーチクエスチョン

  • RQ1平均場勾配降下法で訓練される2層ニューラルネットワークは、一般のリプシッツ連続関数に対して次元の呪いを回避できるか?
  • RQ2浅いReLUネットワークの勾配フローにおいて、高次元設定での収束速度の根本的限界は何か?
  • RQ3ターゲット関数の関数空間、特にそれがバロン空間に属するかどうかが、高次元における訓練速度に与える影響は何か?
  • RQ4高次元設定において、経験的リスクは人口リスクよりも速く減少するのか?どのような条件下でそうなるか?
  • RQ5高次元における収束の遅さは、ニューラルネットワークの関数空間に最小化子が存在しないことに起因するのか?

主な発見

  • バロン空間に属さない任意のリプシッツ連続関数に対して、人口リスクの減少速度は $ t^{-4/(d-2)} $ より速くはならない。これは高次元における根本的な遅れを示唆する。
  • 次元 $ d $ が増加するにつれて収束速度は無限に遅くなり、$ \gamma = 4/(d-2) \to 0 $ となるため、$ d \to \infty $ のとき次元の呪いが確認される。
  • ターゲット関数がバロン空間に属する場合、経験的リスクおよび人口リスクの両方が約 $ t^{-1.5} $ の速度で減少し、これは速くかつ次元に依存しにくい。
  • 数値実験では、非バロン関数に対しては、高次元(例:$ d=250 $)で4,000サンプルを用いた場合、経験的リスクは速やかに減少するが、分布の不一致およびパrameter数の増加により人口リスクは増加する。
  • 初期の「径方向」段階(パrameterノルムの急激な増加)から安定な「角度方向」段階(方向の更新のみ)への遷移は、おおよそ $ t \approx 7 $ で発生し、訓練ダイナミクスの変化を示す。
  • トレーニング中、パスノルムはゆっくりと増加するため、バロン空間外の複雑な高次元ターゲット関数への適応速度が制限される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。