Skip to main content
QUICK REVIEW

[論文レビュー] A type of generalization error induced by initialization in deep neural networks

Yaoyu Zhang, Zhi‐Qin John Xu|arXiv (Cornell University)|May 19, 2019
Model Reduction and Neural Networks参考文献 34被引用数 14
ひとこと要約

本稿は、非ゼロのランダム初期化によって引き起こされる深層ニューラルネットワーク(DNN)における一般化誤差を特定し、ニューラルタングエント・カーネル(NTK)領域において、DNNがパrameter空間における初期重みに最も近いグローバル最小値に収束することを示している。これは、初期化が非ゼロであると誤差が増加することを意味する。著者らは、この誤差を排除し、学習を加速するための反対称初期化(ASI)を提案し、NTKおよび非NTK領域の両方で理論的・実験的妥当性を検証している。

ABSTRACT

How initialization and loss function affect the learning of a deep neural network (DNN), specifically its generalization error, is an important problem in practice. In this work, by exploiting the linearity of DNN training dynamics in the NTK regime \citep{jacot2018neural,lee2019wide}, we provide an explicit and quantitative answer to this problem. Focusing on regression problem, we prove that, in the NTK regime, for any loss in a general class of functions, the DNN finds the same \emph{global} minima---the one that is nearest to the initial value in the parameter space, or equivalently, the one that is closest to the initial DNN output in the corresponding reproducing kernel Hilbert space. Using these optimization problems, we quantify the impact of initial output and prove that a random non-zero one increases the generalization error. We further propose an antisymmetrical initialization (ASI) trick that eliminates this type of error and accelerates the training. To understand whether the above results hold in general, we also perform experiments for DNNs in the non-NTK regime, which demonstrate the effectiveness of our theoretical results and the ASI trick in a qualitative sense. Overall, our work serves as a baseline for the further investigation of the impact of initialization and loss function on the generalization of DNNs, which can potentially guide and improve the training of DNNs in practice.

研究の動機と目的

  • 初期化と損失関数が深層ニューラルネットワークにおける一般化誤差に与える影響を理解すること。
  • NTK領域における非ゼロ初期化が一般化誤差に与える影響を定量化すること。
  • この初期化に起因する誤差を低減する手法を開発し、学習効率を向上させること。
  • 理論的発見がNTK領域を超えて実用的な非NTKDNNにまで適用可能かどうか、実験的に検証すること。

提案手法

  • NTK領域における理論的分析を行い、DNN学習ダイナミクスの線形性を活用する。
  • 著者らは、DNNがパrameter空間における初期重みに最も近いグローバル最小値に収束することを証明している。これは、再生核ヒルベルト空間における初期出力と最も近いものに相当する。
  • 一般クラスの損失関数を検討し、最適化パスが特定の損失関数に依存しないことを示している(ただし、そのクラスに属する限り)。
  • 初期出力が一般化誤差に与える影響を定量化し、非ゼロ初期化が誤差を増加させることを明らかにしている。
  • 初期出力をゼロに保つことで初期化に起因する誤差を相殺する反対称初期化(ASI)のテクニックを提案している。
  • 理論的発見とASIの有効性・ロバスト性を検証するために、NTKおよび非NTK領域の両方で実験を実施している。

実験結果

リサーチクエスチョン

  • RQ1NTK領域において、非ゼロのランダム初期化はDNNの一般化誤差にどのように影響するか?
  • RQ2グローバル最小値に収束しているにもかかわらず、異なる初期化が異なる一般化誤差をもたらすのはなぜか?
  • RQ3初期化に起因する一般化誤差を体系的に低減または除去することは可能か?
  • RQ4NTK領域で観察された理論的挙動は、実用的で非NTKなDNNに対しても拡張可能か?
  • RQ5提案された反対称初期化(ASI)は、初期化に起因する誤差を低減し、学習を加速させるためにどれほど効果的か?

主な発見

  • NTK領域において、一般クラスの損失関数を用いて学習されたDNNは、パrameter空間における初期重みに最も近いグローバル最小値に収束する。
  • この収束点は、再生核ヒルベルト空間における初期DNN出力と最も近いものに対応し、初期化に起因する一般化誤差を定量化する。
  • 非ゼロのランダム初期化は、関数空間における最適解が原点からずれることで、一般化誤差を増加させる。
  • 提案された反対称初期化(ASI)は、初期出力をゼロに保つことで、この誤差を完全に除去し、関数空間における原点に一致する解に一致させる。
  • 非NTK領域における実験から、理論的知見とASIのテクニックが定性的に有効であることが示され、より広範な適用可能性が示唆されている。
  • 本研究の結果は、初期化と損失関数がDNN一般化に果たす役割を理解するための基準を確立し、学習の安定性とパフォーマンスに実用的インパクトを与える。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。