Skip to main content
QUICK REVIEW

[論文レビュー] Piecewise linear activations substantially shape the loss surfaces of neural networks

Fengxiang He, Bohan Wang|arXiv (Cornell University)|Mar 27, 2020
Stochastic Gradient Optimization Techniques被引用数 19
ひとこと要約

本稿では、ReLU などの区分線形活性化関数が、深層ニューラルネットワークの損失関数の形状を著しく変化させることを示しており、たとえ単一の隠れ層を持つシンプルなネットワークであっても、無限個の偽の局所最小値を誘発することがある。著者らは、これらの最小値が、微分不可能な境界によって分割される滑らかで多線形な細胞内に集中した連結された谷間の領域に存在することを証明しており、各細胞内におけるすべての局所最小値が、その細胞のパラメータ部分空間においてグローバルに最適であることを示している。

ABSTRACT

Understanding the loss surface of a neural network is fundamentally important to the understanding of deep learning. This paper presents how piecewise linear activation functions substantially shape the loss surfaces of neural networks. We first prove that {\it the loss surfaces of many neural networks have infinite spurious local minima} which are defined as the local minima with higher empirical risks than the global minima. Our result demonstrates that the networks with piecewise linear activations possess substantial differences to the well-studied linear neural networks. This result holds for any neural network with arbitrary depth and arbitrary piecewise linear activation functions (excluding linear functions) under most loss functions in practice. Essentially, the underlying assumptions are consistent with most practical circumstances where the output layer is narrower than any hidden layer. In addition, the loss surface of a neural network with piecewise linear activations is partitioned into multiple smooth and multilinear cells by nondifferentiable boundaries. The constructed spurious local minima are concentrated in one cell as a valley: they are connected with each other by a continuous path, on which empirical risk is invariant. Further for one-hidden-layer networks, we prove that all local minima in a cell constitute an equivalence class; they are concentrated in a valley; and they are all global minima in the cell.

研究の動機と目的

  • 区分線形活性化関数が、ニューラルネットワークの損失関数の幾何的構造にどのように影響を与えるかを理解すること。
  • 区分線形活性化関数を用いた深層ネットワークに、偽の局所最小値が存在するか、その構造を調査すること。
  • 損失関数の幾何的分割が、微分不可能な境界によって分離された滑らかで多線形な細胞に分けられることを明らかにすること。
  • 各細胞内における局所最小値の等価性と連結性を分析し、それらがグローバルに最適な谷構造を形成することを示すこと。

提案手法

  • 任意の深さと区分線形活性化関数(線形関数を除く)を有するネットワークに対して、標準的な損失関数のもとで、無限個の偽の局所最小値が存在することを証明する。
  • 重みパラメータ $ (W_1, W_2) $ から低次元表現 $ \hat{W} $ への写像 $ Q $ を構築し、$ \text{diag}(W_2)W_1 $ の積を保つスケーリング変換に対して $ Q $ が不変であることを示す。
  • 活性化関数のブレークポイントによって誘発される微分不可能な境界を用いて、パラメータ空間を開集合の細胞に分割する。
  • 各細胞内で、経験的リスク $ \hat{\mathcal{R}} $ が $ \hat{W} $ に関して凸であることを示し、各細胞内におけるすべての局所最小値がその細胞内でのグローバル最小であることを示す。
  • 各細胞内における局所最小値が、経験的リスクが一定のまま続く連続的経路によって接続されており、谷構造を形成することを示す。
  • 写像 $ Q $ をもとに等価関係 $ \sim_R $ を定義し、各細胞内におけるすべての局所最小値がこの関係のもとで等価であり、商空間を形成することを示す。

実験結果

リサーチクエスチョン

  • RQ1区分線形活性化関数を有するニューラルネットワークは、通常の学習条件下でも無限個の偽の局所最小値を持つのか?
  • RQ2パラメータ空間において、局所最小値は接続性と経験的リスクの観点からどのように分布しているのか?
  • RQ3区分線形活性化関数を有するニューラルネットワークの損失関数は、微分不可能な境界によって分離された滑らかで多線形な細胞に分割可能か?
  • RQ41つの細胞内におけるすべての局所最小値は、その細胞のパラメータ部分空間においてグローバルに最適か?
  • RQ5細胞内における局所最小値の集合の幾何学的・トポロジカル構造は何か?また、それらはどのように接続されているか?

主な発見

  • 任意の深さと任意の区分線形活性化関数(線形関数を除く)を有するニューラルネットワークは、標準的な損失関数のもとで、無限個の偽の局所最小値を持つ。
  • これらの偽の局所最小値は、パラメータ空間の1つの滑らかで多線形な細胞内に集中した1つの連結された谷間の領域に存在する。
  • 特定の細胞内におけるすべての局所最小値は、その細胞のパラメータ部分空間においてグローバルに最小である。これは、その領域内で可能な限り低い経験的リスクを達成していることを意味する。
  • 細胞内における局所最小値は、経験的リスクが一定のまま続く連続的経路によって接続されており、退化した谷構造を示している。
  • 細胞内における局所最小値の同値類は、写像 $ Q $ によって定義され、$ \text{diag}(W_2)W_1 $ の積を保存する。この同値関係のもとで、商空間が形成される。
  • 損失関数の表面は、活性化関数のブレークポイントから生じる微分不可能な境界によって複数の滑らかで多線形な細胞に分割され、各細胞はその部分空間における一意のグローバル最小値を含む。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。