Skip to main content
QUICK REVIEW

[論文レビュー] On the Principle of Least Symmetry Breaking in Shallow ReLU Models

Yossi Arjevani, Michael Field|arXiv (Cornell University)|Dec 26, 2019
Stochastic Gradient Optimization Techniques参考文献 30被引用数 5
ひとこと要約

本稿は、浅いReLUネットワークにおける確率的勾配降下法(SGD)が、高い等方的部分群を有する臨界点に収束する理由を説明するため、最小対称性破壊の原理を導入する。SGDによって検出された偽の局所最小値は、ターゲットモデルの対称性に対して最大または大きな等方的部分群を示しており、さまざまなデータ分布および活性化関数における損失関数の形状に観察されるパターンを理論的に説明する。

ABSTRACT

We consider the optimization problem associated with fitting two-layer ReLU networks with respect to the squared loss, where labels are assumed to be generated by a target network. Focusing first on standard Gaussian inputs, we show that the structure of spurious local minima detected by stochastic gradient descent (SGD) is, in a well-defined sense, the \emph{least loss of symmetry} with respect to the target weights. A closer look at the analysis indicates that this principle of least symmetry breaking may apply to a broader range of settings. Motivated by this, we conduct a series of experiments which corroborate this hypothesis for different classes of non-isotropic non-product distributions, smooth activation functions and networks with a few layers.

研究の動機と目的

  • SGDが2層ReLUネットワークで検出する偽の局所最小値の構造的パターンを説明すること。
  • 臨界点の対称性が、ターゲットモデル、データ分布、およびネットワークアーキテクチャの共同不変性に支配されているかどうかを調査すること。
  • 最小対称性破壊の原理が等方的ガウス入力にとどまらず、一般化されるかを検証すること。
  • この対称性に基づくメカニズムが非等方的分布、滑らかな活性化関数(例:Leaky-ReLU、Softplus)および深層ネットワークに拡張されるかを探索すること。
  • 反例を特定することで、原理の限界を特定し、対称性破壊が成立しない条件を同定すること。

提案手法

  • 重み行列の行および列の置換に対する2層ReLUネットワークにおける二乗損失の不変性構造を分析する。
  • 対称群 $S_k \times S_d$ および対角部分群 $\Delta S_d$ の等方的部分群のラティスを特徴づけ、最大等方的部分群を同定する。
  • [16]における自己バランス性を、連続的対称性によって誘導される保存則として再定式化する。
  • さまざまな入力分布(ガウス分布、一様分布、相関のある分布)、ターゲット重み行列(単位行列、ブロック対角行列)、活性化関数(ReLU、Leaky-ReLU、Softplus)の下でSGDによる臨界点を経験的に評価する。
  • 観測された臨界点の等方的タイプを、ターゲットモデルの対称性群の理論的最大等方的部分群と比較する。
  • 数値実験を用いて、分布シフト(例:シフトされた一様分布)および深層アーキテクチャにおけるロバストネスをテストする。

実験結果

リサーチクエスチョン

  • RQ1なぜ浅いReLUネットワークにおけるSGDの軌道は、常に高い等方的部分群を有する臨界点に収束するのか?
  • RQ2非等方的かつ非積分入力分布において、最小対称性破壊の原理はどの程度成立するか?
  • RQ3ターゲットモデルの対称性の変化(例:ブロック対角重み行列)に伴い、臨界点の等方的タイプはどのように適応するか?
  • RQ4この対称性に基づく説明は、Leaky-ReLU や Softplus などの滑らかな活性化関数にも拡張可能か?
  • RQ5最小対称性破壊の原理が失敗する条件は何か?また、どのような構造的特徴が対称性破壊を引き起こすか?

主な発見

  • ガウス入力を持つ2層ReLUネットワークにおいて、SGDが検出する偽の局所最小値は、グローバル解の等方的群 $\Delta S_d$ 内で最大または大きな等方的部分群を示す。
  • ターゲット重み行列がブロック対角(例:${\bm{I}}_{d/2} \oplus 2{\bm{I}}_{d/2}$)であっても、臨界点の構造はターゲットモデルの対称性の最大等方的部分群と一致する。
  • 非等方的入力分布(例:$\mathcal{U}([-1+C,1+C]^{20})$)において、$C$ が1に近づくにつれて臨界点の等方的性が低下し、対称性原理の破綻が示唆される。
  • Leaky-ReLU や Softplus の活性化関数に対しても、同様の等方的構造が観測されるが、収束はReLUの場合に比べて通常遅い。
  • 深層全結合ReLUネットワークでは、等方的構造は低層でのみ保持され、深さにわたる対称性の伝播は限定的である。
  • 最小対称性破壊の原理は万能ではない:入力分布が元の対称性を破る場合(例:シフトされた一様分布)には、原理が成立しないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。