Skip to main content
QUICK REVIEW

[論文レビュー] Generalisation dynamics of online learning in over-parameterised neural networks

Sebastian Goldt, Madhu Advani|arXiv (Cornell University)|Jan 25, 2019
Neural Networks and Applications参考文献 44被引用数 7
ひとこと要約

本稿は、教師-生徒フレームワーク下で確率的勾配降下法(SGD)により学習される過パラメータ化された2層ニューラルネットワークの一般化ダイナミクスを研究する。解析的に導出された常微分方程式(ODE)のセットを用いて、一般化誤差が過パラメータ化(L)に比例して線形に増加することを示し、小さな学習率において $ \epsilon_g^* \sim \eta\sigma^2L$ とスケーリングすることを明らかにした。これはオンライン学習におけるモデル容量と一般化性能の間の根本的なトレードオフを示している。

ABSTRACT

Deep neural networks achieve stellar generalisation on a variety of problems, despite often being large enough to easily fit all their training data. Here we study the generalisation dynamics of two-layer neural networks in a teacher-student setup, where one network, the student, is trained using stochastic gradient descent (SGD) on data generated by another network, called the teacher. We show how for this problem, the dynamics of SGD are captured by a set of differential equations. In particular, we demonstrate analytically that the generalisation error of the student increases linearly with the network size, with other relevant parameters held constant. Our results indicate that achieving good generalisation in neural networks depends on the interplay of at least the algorithm, its learning rate, the model architecture, and the data set.

研究の動機と目的

  • 過パラメータ化されたニューラルネットワークが訓練データを記憶可能な能力を持つにもかかわらず、なぜ一般化性能が良いのかを理解すること。
  • 教師ネットワークから生成されたデータを学習する生徒ネットワークの訓練ダイナミクスを、確率的勾配降下法(SGD)を用いてモデル化すること。
  • ネットワークサイズと学習率の観点から、一般化誤差の時間発展を閉形式で記述すること。
  • 過パラメータ化(余剰な隠れユニット)がオンライン学習における一般化性能に与える影響を調査すること。

提案手法

  • 教師ネットワークにM個の隠れユニットを備えた教師-生徒学習設定を定式化し、生徒がその出力からデータを学習する。
  • K個の隠れユニットを備えた2層ネットワークとして生徒ネットワークをモデル化し、K > Mとすることで制御された過パラメータ化(L = K - M)を実現する。
  • 大N極限において、一般化誤差および順序パラメータの時間発展を記述する常微分方程式(ODE)のセットを導出する。
  • 統計物理学的手法を用いて、i.i.d.ガウス入力と有限なノイズ分散 $ \sigma^2$ を仮定したもとで、漸近的一般化誤差 $\n\epsilon_g^*$ を解析的に計算する。
  • 小さな学習率 $\eta$ の領域でODEを摂動的に解き、$\n\epsilon_g^*$ の明示的表現を導出する。
  • MNISTデータ上で結果を検証し、i.i.d.ガウス入力と同様のスケーリング行動を示した。これにより、入力分布に依存しないロバストネスが確認された。

実験結果

リサーチクエスチョン

  • RQ1オンラインSGD学習中、過パラメータ化された生徒ネットワークの一般化誤差はどのように変化するか?
  • RQ2最終的な一般化誤差が過パラメータ化度合い(L)にどのように依存するか?
  • RQ3学習率およびノイズレベルは、過パラメータ化ネットワークの一般化性能に影響を与えるか?
  • RQ4訓練データが有限または大規模な場合、一般化誤差はネットワークサイズにどのようにスケーリングするか?
  • RQ5早期停止は、過パラメータ化による一般化性能への悪影響を緩和するか?

主な発見

  • 収束後の一般化誤差 $\n\epsilon_g^*$ は、過パラメータ化度合いLに比例して線形に増加し、小さな学習率では $\n\epsilon_g^* \sim \eta\sigma^2L$ とスケーリングする。
  • 線形スケーリングは、線形、シグモイド型(erf)、ReLUのさまざまな活性化関数に対して成り立つ。
  • 本モデルは2つの異なる領域を予測する:P ≫ Kの場合、Lを増加させると一般化性能が劣化する。一方、P ≈ Kの場合、一般化性能は安定的または向上する。
  • ODEフレームワークは、合成的なi.i.d.ガウス入力データおよび実世界のMNISTデータの両方で、一般化誤差を正確に予測でき、一貫したスケーリングを示した。
  • 早期停止は、特にシグモイド型ネットワークにおいて過学習を軽減するが、L依存の一般化誤差トレンドを完全に除去はしない。
  • 解析的解は統計物理学的手法を用いて導出され、十分に大きな訓練集合を想定した大N極限において正確である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。