Skip to main content
QUICK REVIEW

[論文レビュー] How Powerful are Shallow Neural Networks with Bandlimited Random Weights?

Ming Li, Sho Sonoda|arXiv (Cornell University)|Aug 19, 2020
Machine Learning and ELM参考文献 60被引用数 8
ひとこと要約

本稿は、帯域制限付きランダム重みを備えた浅いニューラルネットワークの表現力を探る。このようなネットワークは、隠れ層パラメータが有界領域に制限されている場合、ゼロ近似誤差を達成できない可能性がある。リッジレット解析を用いて、近似誤差の非自明な下界を導出し、すべてのランダム重み分布がユニバーサル近似を可能にするわけではないことが証明された。特に、複雑さに依存する特定の分布のみが有効である。

ABSTRACT

We investigate the expressive power of depth-2 bandlimited random neural networks. A random net is a neural network where the hidden layer parameters are frozen with random assignment, and only the output layer parameters are trained by loss minimization. Using random weights for a hidden layer is an effective method to avoid non-convex optimization in standard gradient descent learning. It has also been adopted in recent deep learning theories. Despite the well-known fact that a neural network is a universal approximator, in this study, we mathematically show that when hidden parameters are distributed in a bounded domain, the network may not achieve zero approximation error. In particular, we derive a new nontrivial approximation error lower bound. The proof utilizes the technique of ridgelet analysis, a harmonic analysis method designed for neural networks. This method is inspired by fundamental principles in classical signal processing, specifically the idea that signals with limited bandwidth may not always be able to perfectly recreate the original signal. We corroborate our theoretical results with various simulation studies, and generally, two main take-home messages are offered: (i) Not any distribution for selecting random weights is feasible to build a universal approximator; (ii) A suitable assignment of random weights exists but to some degree is associated with the complexity of the target function.

研究の動機と目的

  • 隠れ層パラメータがランダムに初期化され、固定された場合の浅いニューラルネットワークの表現力を調査すること。
  • パラメータ制約が有界である場合に、このようなランダム重みネットワークが任意の関数をユニバーサルに近似可能かどうかを特定すること。
  • 非凸最適化を避けるもかかわらず、ランダム重みネットワークがゼロ近似誤差を達成できる条件を同定すること。
  • 神経ネットワークに特化した調和解析技術を用いて、近似誤差の理論的下界を確立すること。
  • 1次元/2次元の人工関数および5つの実世界回帰データセットを用いたシミュレーションを通じて、理論的発見を検証すること。

提案手法

  • 浅いニューラルネットワークを $ g_d(x) = \sum_{j=1}^d c_j \sigma(a_j \cdot x - b_j) $ として形式化し、パラメータ $ (a_j, b_j) $ を有界領域 $ V = \{ |a| \leq \lambda, |b| \leq \lambda \} $ 上の分布 $ Q $ からランダムに抽出する。
  • 神経ネットワークに特化したフーリエに類似した調和解析手法であるリッジレット解析を適用し、帯域制限付きランダムネットワークの近似特性を分析する。
  • 近似誤差の $ L^2 $-ノルム下界 $ \|f - g_d\|_{L^2(K)}^2 \geq \|S^* [f]\|_{L^2(V^c)}^2 $ を導出する。ここで $ V^c $ はパラメータ領域の補集合である。
  • ターゲット関数 $ f $ のソボレフノルムおよび $ L^1 $-ノルム、活性化関数の性質を用いて、$ \lambda $, $ m $, および $ s $ に依存する誤差下界を定量化する。
  • カーネルベースのランダム特徴マップを一般のランダム学習法の特別なケースとして採用し、既存のランダム特徴理論と接続する。
  • 1次元および2次元の人工関数、および $ \lambda $ を変化させながら固定された $ L = 10,000 $ を用いた5つの実世界回帰データセットに対して、理論的結果のシミュレーションによる検証を実施。

実験結果

リサーチクエスチョン

  • RQ1帯域制限付きランダム重みを備えた浅いニューラルネットワークは、任意の $ L^2 $-ソボレフ関数をユニバーサルに近似可能か?
  • RQ2隠れ層パラメータが有界領域に制限されている場合、得られる最小近似誤差は何か?
  • RQ3ランダム重み分布の選択が、複雑なターゲット関数を近似する能力に与える影響は何か?
  • RQ4近似誤差が著しく低下する臨界閾値 $ \lambda^* $ が存在するか? その閾値は関数の複雑さとどのように関係するか?
  • RQ5理論的下界は、多様な合成的および実世界の回帰タスクにおいて、実証的に検証可能か?

主な発見

  • 隠れ層パラメータが有界領域 $ |a| \leq \lambda, |b| \leq \lambda $ に制限されている場合、無限個の隠れユニットを用いても、ゼロ近似誤差を達成できない可能性がある。
  • 近似誤差は $ \|S^* [f]\|_{L^2(V^c)}^2 $ で下界づけられ、これはターゲット関数のソボレフノルムおよび活性化関数の $ L^\infty $-ノルムに依存する。
  • $ \lambda \in (0, \vartheta) $ の場合、誤差下界は $ \|f\|_{L^1(K)}^2 \|\sigma\|_{L^\infty}^2 \lambda^m $ に比例し、$ \lambda $ が小さいと近似性能が著しく劣化することが示唆される。
  • $ \lambda \geq \vartheta $ の場合、誤差は $ \|f\|_{H^s(\Omega)}^2 C_{\sigma,s}^2 \lambda^{-2s} $ に比例して減少し、$ \lambda $ が大きくなるほど近似性能が向上することが示される。
  • 1次元および2次元の人工関数に対するシミュレーションでは、$ \lambda \leq 1 $ の場合に近似誤差が平坦化するが、$ \lambda \geq 5 $ の場合に著しく低下することが確認され、理論的閾値が裏付けられた。
  • 5つの実世界回帰データセットにおいて、$ \lambda \geq 10 $ の場合、トレーニング誤差は $ \sim 10^{-14} $ まで低下するが、$ \lambda = 0.1 $ の場合、誤差は依然として高い(例:~0.065)ままであり、理論的予測が妥当であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。