Skip to main content
QUICK REVIEW

[論文レビュー] Approximation capabilities of neural networks on unbounded domains

Mingxi Wang, Yang Qu|arXiv (Cornell University)|Oct 21, 2019
Model Reduction and Neural Networks参考文献 24被引用数 6
ひとこと要約

この論文は、ReLU、ELU、シグモイドなどの単調な活性化関数を備えた浅いニューラルネットワークが、$p \geq 2$ に対して $\mathbb{R} \times [0,1]^n$ 上の $L^p$ 関数を普遍的に近似可能であることを確立している。一方、$m \geq 2$ の場合、$\mathbb{R}^m \times [0,1]^n$ 上では任意の非ゼロ $L^p$ 関数を表現できない。これに対して、3層(2つの隠れ層を含む)の深層ReLUネットワークは、$L^p(\mathbb{R}^n)$ において普遍的近似可能であることが証明されており、非コンパクトな定義域上での関数表現において、深さが有する根本的な利点を示している。

ABSTRACT

In this paper, we prove that a shallow neural network with a monotone sigmoid, ReLU, ELU, Softplus, or LeakyReLU activation function can arbitrarily well approximate any L^p(p>=2) integrable functions defined on R*[0,1]^n. We also prove that a shallow neural network with a sigmoid, ReLU, ELU, Softplus, or LeakyReLU activation function expresses no nonzero integrable function defined on the Euclidean plane. Together with a recent result that the deep ReLU network can arbitrarily well approximate any integrable function on Euclidean spaces, we provide a new perspective on the advantage of multiple hidden layers in the context of ReLU networks. Lastly, we prove that the ReLU network with depth 3 is a universal approximator in L^p(R^n).

研究の動機と目的

  • 非有界領域、特に $\mathbb{R} \times [0,1]^n$ および $\mathbb{R}^m \times [0,1]^n$ 上における浅いニューラルネットワークの近似能力を調査すること。
  • ReLU、ELU、シグモイドなどの一般的な活性化関数を備えた浅いネットワークが、非有界領域上での非ゼロ可積分関数を表現できるかどうかを特定すること。
  • 深層ReLUネットワークが $\mathbb{R}^n$ 上の $L^p$ 関数を近似する際の深さによる表現的優位性を明確にすること。
  • 非コンパクトな非有界領域の文脈において、普遍的近似性の新しい理論的基盤を確立すること。

提案手法

  • 均一連続性およびフーリエ解析の性質を用いて、単調で多項式でない活性化関数を備えた浅いネットワークが、$p \geq 2$ の場合に任意の $L^p(\mathbb{R} \times [0,1]^n)$ 関数を近似可能であることを証明する。
  • これらのネットワークが $m \geq 2$ の場合に $\mathbb{R}^m \times [0,1]^n$ 上で非ゼロの $L^p$ 関数を表現できないことを示し、その関数空間がこれらの定義域下で自明であることを証明する。
  • Fubiniの定理を用いて、$\mathbb{R} \times \mathbb{R}^+$ における表現不能性の結果を、より高次元の非有界領域へ拡張する。
  • ReLU活性化関数を用いて深さ3のコンパクトにサポートされた非ゼロ関数 $F$ を構築し、その平行移動およびスケーリングが $L^p(\mathbb{R}^n)$ で稠密であることを証明する。
  • ReLUネットワークの加法およびアフィン変換に対する閉包性と組み合わせ、$F$ のスケーリングおよび平行移動コピーの集合 $S_F$ が $L^p(\mathbb{R}^n)$ で稠密であることを活用する。
  • 関数 $F$ が可積分で、有界で、ほとんど everywhere で連続であり、かつ非ゼロである場合に、[20] の定理5.1により $S_F$ が $L^p(\mathbb{R}^n)$ で稠密であることを適用する。

実験結果

リサーチクエスチョン

  • RQ1ReLU やシグモイド活性化関数を備えた浅いネットワークは、$p \geq 2$ の場合に $\mathbb{R} \times [0,1]^n$ 上の任意の $L^p$ 関数を近似可能か?
  • RQ2標準的な活性化関数を備えた浅いネットワークは、$m \geq 2$ の場合に $\mathbb{R}^m \times [0,1]^n$ 上で非ゼロの $L^p$ 関数を表現できるか?
  • RQ3ReLUネットワークが $L^p(\mathbb{R}^n)$ で普遍的近似可能であるために必要な最小の深さは何か?
  • RQ4浅いネットワークの表現力は、有界領域と非有界領域でどのように異なるか?
  • RQ5非有界領域上での関数近似において、深層ReLUネットワークの深さの利点の理論的根拠は何か?

主な発見

  • 単調なシグモイド、ReLU、ELU、Softplus、LeakyReLU などの活性化関数を備えた浅いニューラルネットワークは、$p \geq 2$ の場合に $\mathbb{R} \times [0,1]^n$ 上の任意の $L^p$ 関数を任意の精度で近似可能である。
  • 同じ活性化関数を備えた浅いネットワークは、$m \geq 2$ の場合に $\mathbb{R}^m \times [0,1]^n$ 上で非ゼロの $L^p$ 関数を表現できない。$\mathbb{R} \times \mathbb{R}^+$ を含む。
  • 深さ3(2つの隠れ層を含む)のReLUネットワークは、$p \in [1, \infty)$ の場合に $L^p(\mathbb{R}^n)$ で普遍的近似可能である。これは、以前の深さの上限を改善している。
  • 深さ3のReLU活性化関数を用いて構築された関数 $F$ は連続的で、非負で、コンパクトにサポートされ、非ゼロであり、その平行移動およびスケーリングの集合は $L^p(\mathbb{R}^n)$ で稠密である。
  • 浅いネットワークが $m \geq 2$ の場合に $\mathbb{R}^m \times [0,1]^n$ 上で表現できないのは、$\mathbb{R} \times \mathbb{R}^+$ 上で非ゼロ関数を表現できないこと、すなわち均一連続性および減衰制約に起因する。
  • この結果は、ReLUネットワークにおける深さの根本的利点を明らかにしている:浅いネットワークは高次元非有界領域では失敗するが、3層の深層ネットワークは $L^p(\mathbb{R}^n)$ で普遍的近似を達成できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。