Skip to main content
QUICK REVIEW

[論文レビュー] Topological properties of the set of functions generated by neural networks of fixed size

Philipp Petersen, Mones Raslan|arXiv (Cornell University)|Jun 21, 2018
Machine Learning and ELM被引用数 7
ひとこと要約

本稿は、固定アーキテクチャのニューラルネットワークによって実装可能な関数の集合の位相的構造を調査し、この集合が通常、凸でなく、$L^p$ や $L^\infty$ ノルムに関して閉じておらず(ReLU や PReLU を除く)、逆安定性を欠いていることを明らかにした。これらの性質は、深層学習における非収束、パラメータの爆発、最適化の遅さといった根本的な訓練の困難さを説明している。これは、関数の差が小さくても発生する。

ABSTRACT

We analyze the topological properties of the set of functions that can be implemented by neural networks of a fixed size. Surprisingly, this set has many undesirable properties. It is highly non-convex, except possibly for a few exotic activation functions. Moreover, the set is not closed with respect to $L^p$-norms, $0 < p < \\infty$, for all practically-used activation functions, and also not closed with respect to the $L^\\infty$-norm for all practically-used activation functions except for the ReLU and the parametric ReLU. Finally, the function that maps a family of weights to the function computed by the associated network is not inverse stable for every practically used activation function. In other words, if $f_1, f_2$ are two functions realized by neural networks and if $f_1, f_2$ are close in the sense that $\\|f_1 - f_2\\|_{L^\\infty} \\leq \\varepsilon$ for $\\varepsilon > 0$, it is, regardless of the size of $\\varepsilon$, usually not possible to find weights $w_1, w_2$ close together such that each $f_i$ is realized by a neural network with weights $w_i$. Overall, our findings identify potential causes for issues in the training procedure of deep learning such as no guaranteed convergence, explosion of parameters, and slow convergence.

研究の動機と目的

  • 固定サイズのニューラルネットワークによって実装可能な関数の集合の位相的性質(凸性、閉性、安定性)を分析すること。
  • 深層学習における実際の訓練の困難さの背後にある、固定サイズネットワークの関数空間における構造的欠陥を特定すること。
  • ネットワーク重みから関数への実現写像が逆安定性を満たすかどうかを調査すること。これは最適化収束の鍵となる性質である。
  • どの活性化関数の下で関数空間が $L^p$ および $L^\infty$ ノルムに関して閉じているかを特定すること。
  • 統計的または近似理論的フレームワークに依存しない、非漸近的かつ幾何的な観点から、深層学習で観察される訓練の不安定性を説明すること。

提案手法

  • リプシッツ定数が増加するが、コン pact 領域上で一様にゼロに収束する ReLU を用いたニューラルネットワークの系列を構築する。
  • ネットワーク重みを $C(\Omega)$ 内の関数へ写像する実現写像 $\mathrm{R}^\Omega_\varrho$ を用い、その位相的性質を分析する。
  • スケーリングノルム $\|\cdot\|_{\mathrm{scaling}}$ を用いて、実現関数のリプシッツ定数を束縛し、ネットワーク重みと関数の滑らかさの関係を確立する。
  • 商写像理論を用いて、関数集合が閉じていない場合には実現写像が商写像でないことを示す。
  • 関数集合が $L^\infty$ ノルムに関して閉じていないことと、リプシッツ定数が無限大に発散することを用いて、逆安定性の欠如を証明する。
  • 重みノルムの有界性とリプシッツ定数の無限大発散に基づく背理法を用いて、主要な位相的性質を証明する。

実験結果

リサーチクエスチョン

  • RQ1固定サイズのニューラルネットワークによって実装可能な関数の集合は、標準的な活性化関数に対して凸であるか?
  • RQ2どの $L^p$ ノルムに関して関数集合が閉じており、これは活性化関数に依存するか?
  • RQ3ネットワーク重みから関数への実現写像は逆安定性を満たすか、すなわち小さな関数の差が小さな重みの差を意味するか?
  • RQ4固定サイズネットワークの関数空間は一様収束に関して閉じているか。最適化に及ぼす影響は何か?
  • RQ5関数空間のどの位相的性質が、非収束やパラメータの爆発といった訓練の不安定性を説明するか?

主な発見

  • 固定サイズのニューラルネットワークによって実装可能な関数の集合は、標準的な活性化関数に対しては、どれに対しても凸でない(おそらく例外的なもの以外)。
  • 実用的に使用されるすべての活性化関数に対して、$0 < p < \infty$ の $L^p$ ノルムに関して、関数集合は閉じていない。
  • 標準的な活性化関数に対して、すべての関数集合は $L^\infty$ ノルムに関して閉じていないが、ReLU およびパラメトリック ReLU を除く。
  • 実用的に使用されるすべての活性化関数に対して、実現写像は逆安定でない。これは、小さな関数の差が小さな重みの差を意味しないことを示している。
  • 関数がコン pact 領域上で一様にゼロに収束しても、実現関数のリプシッツ定数が任意に大きく増加する可能性があるため、重みから関数への写像に不安定性が生じる。
  • これらの位相的欠陥――非凸性、非閉性、逆安定性の欠如――が、深層学習における非収束やパラメータの爆発といった一般的な訓練の問題を幾何的に説明する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。