Skip to main content
QUICK REVIEW

[論文レビュー] Geometry of the Loss Landscape in Overparameterized Neural Networks: Symmetries and Invariances

Berfin Şimşek, François Gaston Ged|arXiv (Cornell University)|May 25, 2021
Stochastic Gradient Optimization Techniques参考文献 37被引用数 14
ひとこと要約

この論文は、置換対称性と不変性を分析することで、過パラメータ化された2層および多層ニューラルネットワークにおける損失関数の幾何的構造を調査する。1層あたり1つのニューロンを追加することで、離散的なグローバルミニマが1つのゼロ損失臨界点の連結多様体に結合され、この多様体に含まれるアフィン部分空間の数は、やや過パラメータ化された状態(h ≪ r∗)と著しく過パラメータ化された状態(h ≫ r∗)で異なるスケーリングを示す—h ≪ r∗のときには対称性に起因する臨界点が支配的となり、h ≫ r∗のときにはグローバルミニマ部分空間が支配的になる。

ABSTRACT

We study how permutation symmetries in overparameterized multi-layer neural networks generate `symmetry-induced' critical points. Assuming a network with $ L $ layers of minimal widths $ r_1^*, \ldots, r_{L-1}^* $ reaches a zero-loss minimum at $ r_1^*! \cdots r_{L-1}^*! $ isolated points that are permutations of one another, we show that adding one extra neuron to each layer is sufficient to connect all these previously discrete minima into a single manifold. For a two-layer overparameterized network of width $ r^*+ h =: m $ we explicitly describe the manifold of global minima: it consists of $ T(r^*, m) $ affine subspaces of dimension at least $ h $ that are connected to one another. For a network of width $m$, we identify the number $G(r,m)$ of affine subspaces containing only symmetry-induced critical points that are related to the critical points of a smaller network of width $r

研究の動機と目的

  • 過パラメータ化されたニューラルネットワークにおける置換対称性が臨界点をどのように生成し、グローバルミニマの接続性にどのように影響するかを理解すること。
  • アフィン部分空間の数と次元の観点から、グローバルミニマ多様体の幾何的構造を特徴づけること。
  • ネットワークの幅と過パラメータ化の関数として、対称性に起因する臨界部分空間およびグローバルミニマ部分空間の数の閉形式の式を導出すること。
  • やや過パラメータ化(h ≪ r∗)と著しく過パラメータ化(h ≫ r∗)の両状態におけるこれらの部分空間のスケーリング行動を調査すること。
  • 小さなネットワークにおけるサドルポイントが、ニューロンを追加することで、局所的最小値ではなく対称性に起因するサドルポイントに変化することを示すこと。

提案手法

  • 多層ネットワークにおける置換対称性を活用し、幅 r の狭いネットワークから幅 m = r + h の広いネットワークへの臨界点の写像を構築することで、対称性に起因する臨界部分空間を生成する。
  • 組合せ的解析を用いて、2層ネットワークにおけるグローバルミニマ多様体を構成するアフィン部分空間の数 T(r∗, m) の閉形式表現を導出する。
  • 幅 r < r∗ のより狭いネットワークに関連する対称性に起因する臨界点のみを含むアフィン部分空間の数 G(r, m) を導出する。
  • 漸近的解析と帰納法を用いて、h ≪ r∗ および h ≫ r∗ の極限における T(r∗, m) および G(r∗−k, m) のスケーリング行動を確立する。
  • 少なくとも1つのニューロンを各隠れ層に追加することで、グローバルミニマ多様体がすべての層にわたって連結されたままであることを示すことで、多層ネットワークへの分析を拡張する。
  • G(r, m) の精密な漸近的解析には Nørlund-Rice 積分と鞍点法を適用するが、これは主な結果の範囲外であるとされている。

実験結果

リサーチクエスチョン

  • RQ1過パラメータ化されたニューラルネットワークにおける置換対称性がどのように臨界点を生成し、グローバルミニマの接続性に影響を与えるか。
  • RQ22層の過パラメータ化されたネットワークにおけるグローバルミニマ多様体の正確な幾何的構造(アフィン部分空間の数と次元)は何か。
  • RQ3やや過パラメータ化(h ≪ r∗)と著しく過パラメータ化(h ≫ r∗)の両状態において、対称性に起因する臨界部分空間の相対的な数がグローバルミニマ部分空間の数とどのようにスケーリングされるか。
  • RQ4幅 r の狭いネットワークにおけるサドルポイントが、ニューロンを追加することで拡張されたネットワークにおいて、局所的最小値に変化することができるか。
  • RQ5深層ネットワークにおいて、複数の隠れ層にニューロンを追加すると、グローバルミニマ多様体の接続性はどのように変化するか。

主な発見

  • 最小幅 r∗₁,…,r∗_{L−1} の L 層ネットワークに1層あたり1つのニューロンを追加することは、r∗₁!⋯r∗_{L−1} 個の孤立したグローバルミニマを1つの連結したゼロ損失多様体に接続するのに十分である。
  • 幅 m = r∗ + h の2層ネットワークにおいて、グローバルミニマ多様体は次元が少なくとも h の T(r∗, m) 個のアフィン部分空間から構成され、この多様体は連結である。
  • やや過パラメータ化状態(h ≪ r∗)では、対称性に起因する臨界部分空間の数(G(r∗−k, m))がグローバルミニマ部分空間の数(T(r∗, m))を上回り、サドルポイントの増加を示している。
  • 著しく過パラメータ化状態(h ≫ r∗)では、グローバルミニマ部分空間の数(T(r∗, m))が対称性に起因する臨界部分空間の数(G(r∗−k, m))を上回り、非常に大きなグローバルミニマ多様体を示している。
  • G(r, m) の漸近的挙動は、固定された r に対して m が大きいとき ∼rm であり、やや過パラメータ化状態では T(r∗, m) ∼(r∗)^h / (2^h h! m!) となる。
  • 幅 r の狭いネットワークにおけるサドルポイントは、広いネットワークに拡張された際に、局所的最小値ではなく対称性に起因するサドルポイントに変化し、最適化の多様体構造が保存される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。