Skip to main content
QUICK REVIEW

[論文レビュー] Achieve the Minimum Width of Neural Networks for Universal Approximation

Yongqiang Cai|arXiv (Cornell University)|Sep 23, 2022
Model Reduction and Neural Networks被引用数 4
ひとこと要約

本稿は、コンpact領域上の $ L^p $ 範囲および連続ノルムにおけるユニバーサル近似を実現する必要となる全結合ニューラルネットワークの最小幅について、普遍的な下界 $ w^{*}_{\text{min}} = \max(d_x, d_y) $ を確立する。この下界がタイトであることを、leaky-ReLUおよびUOE活性化関数を用いたネットワークの構築により証明し、ニューラルODEとフローマップ近似を活用して最適な幅を達成することで、任意の活性化関数に対して最小幅に関する長年の未解決問題を解決する。

ABSTRACT

The universal approximation property (UAP) of neural networks is fundamental for deep learning, and it is well known that wide neural networks are universal approximators of continuous functions within both the $L^p$ norm and the continuous/uniform norm. However, the exact minimum width, $w_{\min}$, for the UAP has not been studied thoroughly. Recently, using a decoder-memorizer-encoder scheme, \citet{Park2021Minimum} found that $w_{\min} = \max(d_x+1,d_y)$ for both the $L^p$-UAP of ReLU networks and the $C$-UAP of ReLU+STEP networks, where $d_x,d_y$ are the input and output dimensions, respectively. In this paper, we consider neural networks with an arbitrary set of activation functions. We prove that both $C$-UAP and $L^p$-UAP for functions on compact domains share a universal lower bound of the minimal width; that is, $w^*_{\min} = \max(d_x,d_y)$. In particular, the critical width, $w^*_{\min}$, for $L^p$-UAP can be achieved by leaky-ReLU networks, provided that the input or output dimension is larger than one. Our construction is based on the approximation power of neural ordinary differential equations and the ability to approximate flow maps by neural networks. The nonmonotone or discontinuous activation functions case and the one-dimensional case are also discussed.

研究の動機と目的

  • 任意の活性化関数を用いる全結合ニューラルネットワークにおけるユニバーサル近似に必要な正確な最小幅を特定すること。
  • $ L^p $-および連続ノルムの両方におけるユニバーサル近似に適用可能な、最小幅に関する普遍的な下界を確立すること。
  • この最小幅を達成するニューラルネットワークアーキテクチャを構築し、下界のタイト性を示すこと。
  • 特に非単調的および不連続な活性化関数が最小幅の達成に果たす役割を調査すること。
  • ニューラルODEとフローマップ近似を通じて、ユニバーサル近似を位相的性質と結びつけること。

提案手法

  • レベル集合とホメオモーティズムに基づく反例を用いた位相的議論により、普遍的な下界 $ w^{*}_{\text{min}} = \max(d_x, d_y) $ を導出する。
  • ニューラル常微分方程式(ODE)に基づく新規な構築法を提案し、ODEのフローマップがニューラルネットワークで近似可能であることを示し、最小幅でのユニバーサル近似を達成することを示す。
  • $ C $-UAP に適したエンコーダ・メモライザー・デコーダフレームワークを用い、 $ \lfloor x \rfloor $ やUOE(極値のユニバーサル順序付け)関数といった不連続活性化関数を統合する。
  • leaky-ReLU ネットワークが最小幅 $ \max(d_x, d_y, 2) $ を達成でき、leaky-ReLU+ABS または UOE+FLOOR ネットワークが $ \max(d_x, d_y) $ を達成できることを示し、特定の条件下で最適性を証明する。
  • 連続的かつ単調的な活性化関数(例:leaky-ReLU)が $ d_x \geq d_y $ の場合に $ w^{*}_{\text{min}} $ を達成できないことを、ホメオモーティズムの制約により位相的推論で示す。
  • $ d_x = 1 $ の場合にUOE活性化関数を用いることで $ w^{*}_{\text{min}} = d_y $ を達成でき、位相的不変性を用いて高次元への拡張を示す。

実験結果

リサーチクエスチョン

  • RQ1任意の活性化関数を用いる全結合ニューラルネットワークにおけるユニバーサル近似に必要な最小幅の普遍的な下界は何か?
  • RQ2この下界は特定の活性化関数によって達成可能か? もしそうなら、どのような関数か?
  • RQ3ニューラルODEおよびフローマップ近似は、最小幅でのユニバーサル近似を達成するためにどのように寄与するか?
  • RQ4連続的かつ単調的な活性化関数が特定の状況で最小幅を達成できない理由は何か? その背後にある位相的制約は何か?
  • RQ5最小幅 $ \max(d_x, d_y) $ は、連続的活性化関数のみで達成可能か、それとも不連続または非単調な関数が不可欠か?

主な発見

  • 任意の活性化関数を用いるニューラルネットワークの最小幅に関する普遍的な下界は $ w^{*}_{\text{min}} = \max(d_x, d_y) $ であり、これはコンパクト領域上での $ L^p $-および連続ノルムのユニバーサル近似に共通して成立する。
  • この下界はタイトである:leaky-ReLU ネットワークは $ w^{*}_{\text{min}} = \max(d_x, d_y, 2) $ を達成し、leaky-ReLU+ABS または UOE+FLOOR ネットワークは $ w^{*}_{\text{min}} = \max(d_x, d_y) $ を達成することで、最適性が証明される。
  • $ L^p $-UAP においては、$ d_x > 1 $ または $ d_y > 1 $ の場合に、leaky-ReLU ネットワークがニューラルODEおよびフローマップの近似能力を活用して最小幅 $ \max(d_x, d_y) $ を達成する。
  • $ C $-UAP においては、UOE+FLOOR ネットワークが最小幅 $ \max(d_x, d_y) $ を達成する。特に $ d_x = 1 $ の場合、$ w^{*}_{\text{min}} = d_y $ となる。
  • 位相的制約により、連続的かつ単調な活性化関数(例:leaky-ReLU)は $ d_x \geq d_y $ の場合に、非自明なレベル集合を持つ関数を近似できないため、$ w^{*}_{\text{min}} $ を達成できないことが示される。
  • ニューラルODEによる構築は、ユニバーサル近似を微分同相写像およびフローマップの近似と結びつける、新たな幾何学的・位相的視点を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。