[論文レビュー] Minimum weight norm models do not always generalize well for over-parameterized problems
この論文は、過パラメータ化された設定において最小重みノルム解が一般化性能が最良であるという仮定に挑戦する。簡略化されたおよび実用的なディープラーニングのシナリオにおける実証的分析を通じて、適応的最適化手法が、重みノルムが大きいモデルを生成してもSGDを上回る性能を示すことを示しており、ノルム最小化が一般化性能の普遍的代理指標ではないことを示唆している。
This work is substituted by the paper in arXiv:2011.14066. Stochastic gradient descent is the de facto algorithm for training deep neural networks (DNNs). Despite its popularity, it still requires fine tuning in order to achieve its best performance. This has led to the development of adaptive methods, that claim automatic hyper-parameter optimization. Recently, researchers have studied both algorithmic classes via toy examples: e.g., for over-parameterized linear regression, Wilson et. al. (2017) shows that, while SGD always converges to the minimum-norm solution, adaptive methods show no such inclination, leading to worse generalization capabilities. Our aim is to study this conjecture further. We empirically show that the minimum weight norm is not necessarily the proper gauge of good generalization in simplified scenaria, and different models found by adaptive methods could outperform plain gradient methods. In practical DNN settings, we observe that adaptive methods can outperform SGD, with larger weight norm output models, but without necessarily reducing the amount of tuning required.
研究の動機と目的
- 過パラメータ化された機械学習問題において、最小重みノルム解が一貫してより良い一般化性能を示すかどうかを調査すること。
- 簡略化されたおよび実世界のディープニューラルネットワーク設定におけるSGDと適応的最適化手法の一般化性能を評価すること。
- SGDの最小ノルムインダクティブバイアスが良好な一般化のための必要条件かどうかを特定すること。
- 最小ノルム解に収束しないが、それでも優れた一般化性能を達成できる適応的手法の一般化性能を評価すること。
提案手法
- 過パラメータ化された線形回帰モデルにおける最適化ダイナミクスの実証的評価を、簡略化されたテストベッドとして用いる。
- 制御された過パラメータ化設定下で、SGDと適応的最適化手法(例:Adam、RMSProp)の一般化性能を比較する。
- 異なる最適化手法における重みノルムの大きさと一般化誤差の関係を分析する。
- SGDと適応的最適化手法を用いた実用的ディープニューラルネットワークの訓練を評価し、テスト精度と重みノルムの大きさを測定する。
- ノルム最小化とノルム最小化でない最適化手法の間で一般化行動の乖離を説明するためのトライアル例の使用。
- 簡略化されたおよび実際のDNN設定において、重みノルムの大きさに依存しないモデルの一般化性能の実証的観察。
実験結果
リサーチクエスチョン
- RQ1過パラメータ化された問題において、最小重みノルム解は常により良い一般化性能を示すのか?
- RQ2適応的最適化手法は、重みノルムが大きいにもかかわらず、一般化性能においてSGDを上回ることができるのか?
- RQ3SGDの最小ノルムインダクティブバイアスは、ディープラーニングにおける良好な一般化のための十分条件または必要条件なのか?
- RQ4実用的なディープニューラルネットワークの訓練シナリオにおいて、適応的手法の一般化性能はSGDと比べてどうなるのか?
主な発見
- 最小重みノルム解が過パラメータ化された問題において普遍的により良い一般化性能を示すとは限らず、広く受け入れられている仮定に疑問を呈する。
- Adamのような適応的最適化手法は、重みノルムが顕著に大きいモデルを生成しても、一般化性能においてSGDを上回る場合がある。
- 簡略化された線形回帰設定では適応的手法の一般化性能はSGDより悪いが、実用的DNNではしばしばSGDを上回る。
- SGDと適応的手法の性能差は、重みノルムの大きさに起因するとは限らず、一般化に影響を与える他の要因が存在することを示唆する。
- 一部の状況でSGDを上回るが、適応的手法は依然として大幅なハイパーパramータチューニングを要するため、自動最適化であるという主張とは矛盾する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。