Skip to main content
QUICK REVIEW

[論文レビュー] Data-Dependence of Plateau Phenomenon in Learning with Neural Network --- Statistical Mechanical Analysis

Yuki Yoshida, Masato Okada|arXiv (Cornell University)|Jan 10, 2020
Neural Networks and Applications被引用数 13
ひとこと要約

本稿は統計力学を用いてニューラルネットワーク学習におけるプラトー現象を分析し、それが入力データ共分散の固有値分布に強く依存することを示している。小さな分散を持つ固有値を持つデータはプラトーを抑制することが分かった。これは、理論的予測とは対照的に、現代のディープラーニングではプラトーがまれである理由を説明する。

ABSTRACT

The plateau phenomenon, wherein the loss value stops decreasing during the process of learning, has been reported by various researchers. The phenomenon is actively inspected in the 1990s and found to be due to the fundamental hierarchical structure of neural network models. Then the phenomenon has been thought as inevitable. However, the phenomenon seldom occurs in the context of recent deep learning. There is a gap between theory and reality. In this paper, using statistical mechanical formulation, we clarified the relationship between the plateau phenomenon and the statistical property of the data learned. It is shown that the data whose covariance has small and dispersed eigenvalues tend to make the plateau phenomenon inconspicuous.

研究の動機と目的

  • 理論的予測におけるプラトー現象と、現代のディープラーニングにおけるその希少性との間にある矛盾を解消すること。
  • 入力データの統計的性質が2層ニューラルネットワークの学習ダイナミクスに与える影響を調査すること。
  • 従来の統計力学的モデルをi.i.d.仮定を超える一般の入力データ分布に拡張すること。
  • プラトー現象を緩和または悪化させる特定のデータ特性を同定すること。
  • 入力共分散行列の固有値スペクトルに基づくマクロな説明を提供すること。

提案手法

  • 大規模な入力次元を仮定した2層パーセプトロンにおける生徒・教師学習フレームワークを構築する。
  • 統計力学的手法を用いて高次元の学習ダイナミクスを、順序パラメータの低次元系に簡略化する。
  • 入力共分散行列の固有値分布にのみ依存する学習ダイナミクスのマクロな方程式を導出する。
  • 数値積分を用いて順序パラメータ系を解き、一般化損失のトレースを分析する。
  • 終端収束速度に対する損失低下の遅さの持続時間と大きさを測定することで、プラトーの長さと高さを定量化する。
  • 等方的および非等方的構造を有する異なる入力共分散構造の間で学習ダイナミクスを比較する。

実験結果

リサーチクエスチョン

  • RQ1入力データ共分散の固有値分布は、ニューラルネットワーク学習におけるプラトー現象の出現にどのように影響するか?
  • RQ2理論的予測とは対照的に、現代のディープラーニングではなぜプラトー現象が稀に観察されるのか?
  • RQ3入力データのスケーリング(すなわち、分散)は、プラトーの長さと深さにどの程度影響を与えるか?
  • RQ4固有値分布の高次モーメント(分散や尖度など)は、プラトーの特性にどのように影響するか?
  • RQ5入力特徴の統計的性質に基づいたデータ前処理によって、プラトー現象を予測または制御できるか?

主な発見

  • プラトー現象はネットワークアーキテクチャだけでなく、入力データ共分散行列の固有値分布に強く依存する。
  • 入力データの固有値が小さくかつ分散が大きい場合(分散が小さく、広がっている場合)、プラトーは短くなり、低くなり、目立たなくなる。
  • 入力分散(μ₁)が小さくなると、プラトーの長さはO(1/μ₁)のスケーリングをはるかに超えて急激に増加し、非線形ネットワークに特有の非線形効果であることが示された。
  • 固有値の2次モーメント(分布の広がり)を増やすと、プラトーの長さは短くなり、高さも低下し、現象が緩和される。
  • MNISTではプラトー現象は存在するが、入力分散が小さい(μ₁ ≈ 0.112)ため、長く浅いものとなり、標準的な学習曲線では見えにくくなっている。
  • 本モデルは、SaadとSolla(1995)およびRieglerとBiehl(1995)の先行研究をi.i.i.d.でない入力データに拡張し、学習ダイナミクスが入力共分散の固有値スペクトルにのみ依存することを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。