Skip to main content
QUICK REVIEW

[論文レビュー] High-Order Approximation Rates for Neural Networks with ReLU k Activation Functions.

Jonathan W. Siegel, Jinchao Xu|arXiv (Cornell University)|Dec 14, 2020
Machine Learning and Algorithms参考文献 31被引用数 14
ひとこと要約

本稿では、ReLU^k活性化関数を用いた浅いニューラルネットワークを研究し、滑らかな関数においてL²([0,1]^d)でO(n^{-(k+1)}log(n))の最適近似レートを達成することを示している。有限要素法やウェーブレットとは異なり、これらのネットワークは次元の呪いをより効果的に克服し、高次元においてスパースグリッドを上回る性能を示す。

ABSTRACT

We study the approximation properties of shallow neural networks (NN) with activation function which is a power of the rectified linear unit. Specifically, we consider the dependence of the approximation rate on the dimension and the smoothness of the underlying function to be approximated. Like the finite element method, such networks represent piecewise polynomial functions. However, we show that for sufficiently smooth functions the approximation properties of shallow ReLU$^k$ networks are much better than finite elements or wavelets, and they even overcome the curse of dimensionality more effectively than the sparse grid method. Specifically, for a sufficiently smooth function $f$, there exists a ReLU$^k$-NN with $n$ neurons which approximates $f$ in $L^2([0,1]^d)$ with $O(n^{-(k+1)}\log(n))$ error. Finally, we prove lower bounds showing that the approximation rates attained are optimal under the given assumptions.

研究の動機と目的

  • 浅いニューラルネットワークがReLU^k活性化関数を用いる場合の近似性能を分析すること。
  • ネットワークサイズnと関数の滑らかさkの両方が高次元領域における近似誤差にどのように影響するかを理解すること。
  • 近似レートの観点から、有限要素法、ウェーブレット、スパースグリッドといった古典的手法と比較して、ReLU^kネットワークが果たす役割を明らかにすること。
  • 滑らかさと次元に関する制約のもとで、導出された近似レートが最適であるかどうかを確立すること。
  • ReLU^kネットワークが、既存の手法と比較して次元の呪いをどれほど効果的に軽減できるかを調査すること。

提案手法

  • k ≥ 1 であるφ(x) = (max(0, x))^k という活性化関数を用いた浅いニューラルネットワークを分析する。
  • 領域の分割上での区分的多項式関数としてネットワークをモデル化し、有限要素法に類似した形で扱う。
  • 近似理論を用いて、目的関数fとそのReLU^kネットワーク近似との間のL²誤差を評価する。
  • fの滑らかさ(kで測定)、ニューロン数n、次元dに依存する誤差バウンドを導出する。
  • 近似理論および関数解析の結果を応用し、近似レートの上界と下界を確立する。
  • 得られたレートを、有限要素法、ウェーブレット、スパースグリッドの既知のバウンドと比較し、高次元における優位性を強調する。

実験結果

リサーチクエスチョン

  • RQ1高次元L²空間における滑らかな関数に対して、浅いReLU^kネットワークの近似レートは何か?
  • RQ2近似誤差は、ニューロン数nと滑らかさパラメータkの両方にどのように依存するか?
  • RQ3高次元において、ReLU^kネットワークは有限要素法、ウェーブレット、スパースグリッドよりも優れた近似レートを達成できるか?
  • RQ4与えられた滑らかさと次元に関する仮定のもとで、導出された近似レートは最適であるか?
  • RQ5古典的手法と比較して、ReLU^kネットワークは次元の呪いをどの程度効果的に軽減できるか?

主な発見

  • 任意の十分に滑らかな関数f ∈ L²([0,1]^d)に対して、n個のニューロンを有するReLU^kネットワークが存在し、fをL²誤差O(n^{-(k+1)}log(n))で近似可能である。
  • 滑らかさと次元に関する仮定のもとで、近似レートO(n^{-(k+1)}log(n))は最適であり、一致する下界によって示された。
  • 滑らかな関数に対して、ReLU^kネットワークは有限要素法やウェーブレットよりも近似レートで優れている。
  • 特に高次元設定において、これらのネットワークはスパースグリッド法よりも次元の呪いをより効果的に克服している。
  • ReLU活性化関数の「k」の値が収束レートを直接制御しており、kが大きいほど近似誤差の減少が速くなる。
  • 誤差バウンドに含まれる対数因子log(n)は必要不可欠であり、現在の仮定のもとでは取り除くことはできない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。