QUICK REVIEW
[論文レビュー] Error bounds for deep ReLU networks using the Kolmogorov--Arnold superposition theorem
Hadrien Montanelli, Haizhao Yang|arXiv (Cornell University)|Jun 27, 2019
Neural Networks and Applications参考文献 22被引用数 5
ひとこと要約
この論文は、コルモゴロフ=アルノルド超和定理の構成的バージョンを活用して、多変数関数を近似する深層ReLUネットワークの誤差バウンドを確立する。特定の連続関数のクラスに対して、ネットワークの深さとサイズが $ olimits\mathcal{O}(\epsilon^{-\log n})$ にスケーリングされることを示し、標準的な $ olimits\mathcal{O}(\epsilon^{-n})$ の増加と比較して次元の呪いが著しく軽減されることを示している。
ABSTRACT
We prove a theorem concerning the approximation of multivariate functions by deep ReLU networks, for which the curse of the dimensionality is lessened. Our theorem is based on a constructive proof of the Kolmogorov--Arnold superposition theorem, and on a subset of multivariate continuous functions whose outer superposition functions can be efficiently approximated by deep ReLU networks.
研究の動機と目的
- 深層学習近似における次元の呪いを軽減するため、深層ReLUネットワークの誤差バウンドを構築すること。
- コルモゴロフ=アルノルド超和定理が、次元の複雑さが低い多変数関数の効率的近似を可能にすることを示すこと。
- 外関数が深層ReLUネットワークによって効率的に近似可能な連続多変数関数のクラスを同定すること。
- リプシッツ連続な内関数と外関数を用いた、超和定理の構成的証明を確立し、実用的なネットワーク設計を可能にすること。
提案手法
- 内関数 $\psi(x_i + ja)$ と外関数 $\phi_j$ を用いた、コルモゴロフ=アルノルド超和定理の構成的バージョンを用いる。
- 深層ReLUネットワークアーキテクチャを用いて、内関数 $\psi$ と外関数 $\phi_j$ を近似し、サブネットワーク $\widetilde{\psi}$ と $\widetilde{\phi}_j^r$ を使用する。
- 三角不等式を適用して、内関数と外関数の近似誤差の和として、総近似誤差のバウンドを求める。
- 誤差バウンドを導出する際、$\epsilon_\psi = \frac{n\epsilon}{2(2n+1)^2\nu_r(f)}$ および $\epsilon_\phi = \frac{\epsilon}{4(2n+1)}$ を設定し、$\|f - \tilde{f}_r\|_{L^\infty} \leq \epsilon$ を満たすようにする。
- 再帰的ネットワーク構築により、深さ $L \leq c_0(1)(W_\psi + W_\phi)$ およびサイズ $W \leq n(2n+1)W_\psi + (2n+1)W_\phi$ を達成する。
- ネットワークサイズのバウンドを確立:$W_\psi \leq \tilde{c}_3(n,r(\epsilon))\epsilon^{-[1+\log_2(n+1)]/2}$ および $W_\phi \leq \tilde{c}_4(n,r(\epsilon))\epsilon^{-1/2}$。
実験結果
リサーチクエスチョン
- RQ1深層ReLUネットワークは、$\mathcal{O}(\epsilon^{-n})$ よりも遅い速度で成長するネットワークサイズで、誤差 $\epsilon$ をもって多変数関数を近似可能か?
- RQ2コルモゴロフ=アルノルド超和定理をどのように構成的に用いることで、深層学習における次元の呪いを軽減できるか?
- RQ3超和の内関数と外関数を制御された誤差で近似するための最小限のネットワーク深さとサイズは何か?
- RQ4近似誤差を内関数と外関数の近似誤差を別々に制御することで分解・バウンドできるか?
主な発見
- 特定の連続多変数関数のクラスに対して、深層ReLUネットワークは誤差 $\epsilon$ をもってそれらを近似可能であり、ネットワークサイズが $\mathcal{O}(\epsilon^{-\log n})$ にスケーリングされ、次元の呪いが軽減される。
- 内関数 $\psi$ を近似するためのネットワークサイズは $\tilde{c}_3(n,r(\epsilon))\epsilon^{-[1+\log_2(n+1)]/2}$ にスケーリングされ、次元 $n$ と関数の正則性 $r(\epsilon)$ に明示的な依存関係を示す。
- 外関数 $\phi_j$ を近似するためのネットワークサイズは $\tilde{c}_4(n,r(\epsilon))\epsilon^{-1/2}$ にスケーリングされ、指数部において次元に依存しない。
- 総ネットワークサイズは $W \leq n(2n+1)W_\psi + (2n+1)W_\phi$ でバウンドされ、深さは $L \leq c_0(1)(W_\psi + W_\phi)$ でバウンドされる。
- 誤差バウンドは、内関数と外関数の近似誤差をバランスさせることで達成され、$\epsilon_\psi$ と $\epsilon_\phi$ を適切に選ぶことで $\|f - \tilde{f}_r\|_{L^\infty} \leq \epsilon$ を満たす。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。