Skip to main content
QUICK REVIEW

[論文レビュー] Optimal rates of approximation by shallow ReLU$^k$ neural networks and applications to nonparametric regression

Yunfei Yang, Ding‐Xuan Zhou|arXiv (Cornell University)|Apr 4, 2023
Mathematical Approximation and Integration参考文献 61被引用数 4
ひとこと要約

この論文は、ホルダー空間の単位球内の関数の変動ノルムを分析することで、浅い ReLU$^k$ 神経ネットワークの最適近似レートを確立する。浅いネットワークがホルダー滑らかさ関数の非パラメトリック回帰においてミニマックス最適収束レートを達成することを証明し、過パラメータ化および畳み込みニューラルネットワークへの結果の拡張により、ほぼ最適レートを得る。

ABSTRACT

We study the approximation capacity of some variation spaces corresponding to shallow ReLU$^k$ neural networks. It is shown that sufficiently smooth functions are contained in these spaces with finite variation norms. For functions with less smoothness, the approximation rates in terms of the variation norm are established. Using these results, we are able to prove the optimal approximation rates in terms of the number of neurons for shallow ReLU$^k$ neural networks. It is also shown how these results can be used to derive approximation bounds for deep neural networks and convolutional neural networks (CNNs). As applications, we study convergence rates for nonparametric regression using three ReLU neural network models: shallow neural network, over-parameterized neural network, and CNN. In particular, we show that shallow neural networks can achieve the minimax optimal rates for learning Hölder functions, which complements recent results for deep neural networks. It is also proven that over-parameterized (deep or shallow) neural networks can achieve nearly optimal rates for nonparametric regression.

研究の動機と目的

  • ニューロン数の観点から、浅い ReLU$^k$ ニューラルネットワークの最適近似レートを確立すること。
  • 浅い ReLU$^k$ ネットワークに関連する変動空間の近似能力を分析すること。
  • 浅い、過パラメータ化、畳み込みニューラルネットワークの3つのモデルを用いた非パラメトリック回帰の収束レートを導出すること。
  • 浅いネットワークがホルダー滑らかさ関数に対してミニマックス最適レートを達成することを示し、既存の深層ネットワークの結果を補完すること。
  • 導出された近似バウンドを用いて、深層および畳み込みネットワークの分析を拡張すること。

提案手法

  • 関数クラス $\mathcal{F}_{\sigma_k}(M)$ を、測度 $\mu$ の全変動が $\|\mu\| \leq M$ で有界な無限幅の浅い ReLU$^k$ ネットワークの集合として定義する。
  • 球面調和関数を用いた積分表現とマウレイ型の確率的サンプリング論法を用いて、変動ノルムに基づく近似誤差の上限を導出する。
  • $(d+2k+1)/2$ より小さい $\alpha$ に対して、$h \in \mathcal{H}^\alpha$ の場合に $\|h - f\|_{L^\infty} \lesssim M^{-2\alpha/(d+2k+1-2\alpha)}$ の近似レートを確立する。
  • 変動ノルム近似結果と [55, 57] の確率的近似バウンドを組み合わせることで、有限幅の浅いネットワークに対する最適レートを導出する。
  • 近似バウンドを応用し、打ち切りを伴う経験的リスク最小化による非パラメトリック回帰の一般化誤差バウンドを導出する。
  • 擬似次元および被覆数の議論を用いて、特に CNN や過パラメータ化モデルのネットワーククラスの複雑さを制御する。

実験結果

リサーチクエスチョン

  • RQ1ホルダー空間 $\mathcal{H}^\alpha$ に属する関数に対して、浅い ReLU$^k$ ニューラルネットワークが達成可能な最適近似レートは何か?
  • RQ2浅い ReLU$^k$ ネットワークは、ホルダー滑らかさ関数の非パラメトリック回帰においてミニマックス最適収束レートを達成できるか?
  • RQ3浅いネットワークの近似レートは、深層および畳み込みニューラルネットワークにどのように拡張できるか?
  • RQ4過パラメータ化ニューラルネットワークは、非パラメトリック回帰においてほぼ最適レートを達成できるか?
  • RQ5活性化関数のべき乗 $k$ が近似レートおよび滑らかさ閾値を決定する上で果たす役割は何か?

主な発見

  • $\alpha < (d+2k+1)/2$ の場合、測度の全変動 $M$ に対して、浅い ReLU$^k$ ネットワークの $L^\infty$ ノルムにおける近似誤差は $\mathcal{O}(M^{-2\alpha/(d+2k+1-2\alpha)})$ のオーダーで減少する。
  • 浅い ReLU$^k$ ネットワークは、$\alpha < (d+2k+1)/2$ の場合、$\mathcal{H}^\alpha$ に対して最適近似レート $\mathcal{O}(N^{-\alpha/d})$ を達成する。これは、Mhaskarの結果を ReLU$^k$ に一般化したものである。
  • 浅いニューラルネットワークは、ホルダー関数の学習においてミニマックス最適収束レートを達成し、非パラメトリック回帰における最良の可能なレートと一致する。
  • 過パラメータ化(深層または浅い)ニューラルネットワークは、非パラメトリック回帰においてほぼ最適収束レートを達成し、誤差バウンドが $\mathcal{O}(n^{-\alpha/(d+\alpha)}(\log n)^4)$ のオーダーである。
  • ReLU活性化関数($k=1$)を用いた畳み込みニューラルネットワークは、$\mathcal{F}_\sigma(1)$ に対して収束レート $\mathcal{O}(n^{-(d+3)/(3d+3)}(\log n)^4)$ を達成し、既存の結果よりもわずかに優れている。
  • 近似結果はソボレフノルムに拡張可能であり、他の滑らかさ空間への一般化の可能性を示唆するが、これは今後の研究に委ねられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。