Skip to main content
QUICK REVIEW

[論文レビュー] Minimum Width for Universal Approximation

Sejun Park, Chulhee Yun|arXiv (Cornell University)|Jun 16, 2020
Complexity and Algorithms in Graphs参考文献 28被引用数 11
ひとこと要約

本稿は、ReLUニューラルネットワークが$L^p$関数を普遍的に近似するために必要な正確な最小幅を確立している:$\max\{d_x+1, d_y\}$、ここで$d_x$は入力次元、$d_y$は出力次元である。著者らは、この境界が$L^p$近似においてタイトであることを証明し、ReLUのみでは一様近似においては成り立たないが、しきい値(ステップ)活性化関数を追加すれば成り立つことを示している。その根拠として、特徴空間におけるネットワークのパス連結成分やループ構造に関する位相的・幾何的議論を用いている。

ABSTRACT

The universal approximation property of width-bounded networks has been studied as a dual of classical universal approximation results on depth-bounded networks. However, the critical width enabling the universal approximation has not been exactly characterized in terms of the input dimension $d_x$ and the output dimension $d_y$. In this work, we provide the first definitive result in this direction for networks using the ReLU activation functions: The minimum width required for the universal approximation of the $L^p$ functions is exactly $\max\{d_x+1,d_y\}$. We also prove that the same conclusion does not hold for the uniform approximation with ReLU, but does hold with an additional threshold activation function. Our proof technique can be also used to derive a tighter upper bound on the minimum width required for the universal approximation using networks with general activation functions.

研究の動機と目的

  • ReLUネットワークによる普遍的近似に必要な正確な最小幅を同定する長年の未解決問題を解消すること。
  • $\max\{d_x+1, d_y\}$ が$L^p$空間における普遍的近似のタイトな下界および上界であるかどうかを特定すること。
  • 同じ幅の閾値が一様近似に対しても成り立つかどうかを調査し、成り立たない場合、例えばしきい値活性化関数の追加といった修正によりタイト性を回復できるかを同定すること。
  • 特徴空間におけるパス連結成分やループの交差といった位相的不変量に基づく、一般化された証明フレームワークを構築すること。

提案手法

  • 特徴空間内に閉曲線$\mathcal{V}$が与えられたとき、点$x$から引いたレイが$\mathcal{V}$と何回交差するかを追跡するための、巻き数$\pi_{\mathcal{V}}(x)$という位相的不変量を構築する。
  • ネットワークのパス$g_{\ell^*}([0,1])$を定義し、それが球体$\mathcal{B}$および境界$\partial\mathcal{B}$とどのように交差するかを分析することで、近似誤差が伝播する主要な領域を特定する。
  • 変換に関してネットワークが不変であることから導かれる性質$g_{\ell^*}(p) \in \partial\mathcal{B}$ならば$f(p) = g_{\ell^*}(p)$を用い、境界付近での近似挙動を制約する。
  • $\mathbb{R}^2 \setminus \mathcal{U}$における有界なパス連結成分の性質を適用し、奇数回$\mathcal{U}$と交差するレイが到達できない点が存在することを示し、これにより位相的障害が生じることを示す。
  • 簡単なループ$\mathcal{V}$を$\mathcal{P}$と$\mathcal{L}(z_1,z_2)$から構成し、幅が小さすぎる場合の巻き数の挙動を解析することで矛盾を導く。
  • しきい値活性化関数を追加することで、一様近似において$\max\{d_x+1, d_y\}$の幅境界が回復され、より強い位相的制御が可能になることを証明する。

実験結果

リサーチクエスチョン

  • RQ1ReLUネットワークが$\mathbb{R}^{d_x}$から$\mathbb{R}^{d_y}$への$L^p$関数を普遍的に近似するための正確な最小幅は何か?
  • RQ2$\max\{d_x+1, d_y\}$の幅は、一様ノルムにおける普遍的近似に十分か、それともReLUネットワークのみでは不十分か?
  • RQ3$\max\{d_x+1, d_y\}$の幅境界が、活性化関数を変更することで一様近似において回復可能か?
  • RQ4ネットワークの特徴空間軌道のどのような位相的・幾何的性質が、最小幅での普遍的近似を可能または不可能にするか?

主な発見

  • ReLUネットワークを用いた$L^p$関数の普遍的近似に必要な最小幅は、正確に$\max\{d_x+1, d_y\}$である。
  • 一様近似においては、ReLUのみでは$\max\{d_x+1, d_y\}$の幅境界が成り立たない。$C([0,1], \mathbb{R}^2)$に対する反例によって示されている。
  • しきい値(ステップ)活性化関数を追加することで、$\max\{d_x+1, d_y\}$の幅境界が回復され、一様近似において十分かつ必要となる。
  • 巻き数とパス連結成分に基づく証明技法により、一般の連続で多項式でない活性化関数に対して、$\max\{d_x+2, d_y+1\}$というタイトな上界が得られる。
  • 著者らは、Luら(2017)が確立した$d_x+1$と$d_x+4$の境界ギャップを埋め、真の最小幅が$\max\{d_x+1, d_y\}$であることを示すことで、長年の文献のギャップを解消した。
  • 結果はタイトである:位相的障害の議論(レイの交差や有界成分)により、$L^p$関数の普遍的近似を達成できるより小さい幅では不可能であることが示されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。