Skip to main content
QUICK REVIEW

[論文レビュー] On the Neural Tangent Kernel of Deep Networks with Orthogonal Initialization

Wei Huang, Weitao Du|arXiv (Cornell University)|Apr 13, 2020
Model Reduction and Neural Networks参考文献 36被引用数 13
ひとこと要約

この論文は、ニューラルタングエント・カーネル(NTK)の観点から、深層ニューラルネットワークにおける直交初期化の役割を調査し、無限幅極限において直交初期化されたネットワークがガウス初期化されたネットワークと同じNTKに収束することを証明している。これは、NTK(ラクティブラーニング)の枠組みでは訓練速度の向上が得られないことを示唆する。しかし、実験的結果では、NTKの枠組み外、特に大きな学習率や深層構造の下で、非線形活性化関数の線形的領域が達成された際に、直交初期化が著しく訓練を加速することが示された。

ABSTRACT

The prevailing thinking is that orthogonal weights are crucial to enforcing dynamical isometry and speeding up training. The increase in learning speed that results from orthogonal initialization in linear networks has been well-proven. However, while the same is believed to also hold for nonlinear networks when the dynamical isometry condition is satisfied, the training dynamics behind this contention have not been thoroughly explored. In this work, we study the dynamics of ultra-wide networks across a range of architectures, including Fully Connected Networks (FCNs) and Convolutional Neural Networks (CNNs) with orthogonal initialization via neural tangent kernel (NTK). Through a series of propositions and lemmas, we prove that two NTKs, one corresponding to Gaussian weights and one to orthogonal weights, are equal when the network width is infinite. Further, during training, the NTK of an orthogonally-initialized infinite-width network should theoretically remain constant. This suggests that the orthogonal initialization cannot speed up training in the NTK (lazy training) regime, contrary to the prevailing thoughts. In order to explore under what circumstances can orthogonality accelerate training, we conduct a thorough empirical investigation outside the NTK regime. We find that when the hyper-parameters are set to achieve a linear regime in nonlinear activation, orthogonal initialization can improve the learning speed with a large learning rate or large depth.

研究の動機と目的

  • 直交初期化が線形領域を超えた非線形深層ネットワークの訓練を、どの程度加速するかを調査すること。
  • 無限幅極限における直交初期化の下でのニューラルタングエント・カーネル(NTK)の挙動を分析すること。
  • 全結合ネットワーク(FCN)および畳み込みニューラルネットワーク(CNN)における直交初期化されたネットワークとガウス初期化されたネットワークのNTKダイナミクスを比較すること。
  • 直交初期化が、特にNTKの枠組み外で、より速い収束をもたらす条件を特定すること。
  • 理論的NTK解析と、直交初期化による訓練速度向上の実験的観察を統合すること。

提案手法

  • ランダム行列理論および自由確率論を用いて、無限幅極限における直交初期化された深層ネットワークのNTKの理論的分析。
  • 直交初期化されたネットワークのNTKが、ガウス初期化されたネットワークと同じ極限に収束することの証明。無限幅の枠組みでは、訓練中にNTKが一定に保たれることを示した。
  • 既存のNTK収束結果を、全結合ネットワーク(FCN)および畳み込みニューラルネットワーク(CNN)の両方における直交初期化に拡張した。
  • スティンの方法および交換可能なペア技術を用いて、事活性化ノルムのバウンディングとヘッセ行列の変動の制御を実施した。
  • CIFAR10を用いたフルバッチ勾配降下法を用いた訓練ダイナミクスの実験的評価。ネットワークの深さ、幅、学習率、初期化タイプを変化させた。
  • 複数のアーキテクチャおよびハイパーパramータ設定において、直交初期化とガウス初期化のネットワークの学習速度および汎化性能を比較した。

実験結果

リサーチクエスチョン

  • RQ1深層ネットワークにおいて、無限幅極限において直交初期化とガウス初期化のNTKに違いがあるか?
  • RQ2無限幅の直交初期化ネットワークにおいて、訓練中にNTKが一定に保たれるか、ガウス初期化の場合と同様のラクティブラーニング的挙動を示すか?
  • RQ3NTKの枠組み内、すなわち初期化の周囲でネットワークが線形的に振る舞う状況において、直交初期化が訓練を加速するか?
  • RQ4大きな学習率や深さといった条件下で、NTKの枠組み外において直交初期化が訓練速度を向上させる条件は何か?
  • RQ5深く広いアーキテクチャにおいて、直交初期化されたネットワークとガウス初期化されたネットワークの収束速度および汎化性能の比較は?

主な発見

  • 無限幅極限において、直交初期化された深層ネットワークのNTKは、ガウス初期化されたネットワークと同じ極限に収束する。これは、NTKの枠組み内では理論的利点がないことを示唆する。
  • 無限幅の枠組みにおいて、直交初期化されたネットワークのNTKは、訓練中に一定に保たれ、ガウス初期化ネットワークと同様にラクティブラーニング的挙動を示す。
  • 実験的結果では、学習率が大きく、またはネットワークが非常に深い場合、NTKの枠組み外において、直交初期化がガウス初期化よりも収束が速いことが示された。
  • ネットワークの深さが増すにつれて、直交初期化とガウス初期化の性能差は拡大し、特に訓練速度および最終的な汎化精度の面で顕著であった。
  • ハイパーパramータを調整して非線形活性化関数の線形的領域を達成した場合、直交初期化は訓練ダイナミクスを改善した。
  • 大きな学習率および深層ネットワークの状況では、直交初期化されたネットワークは、ガウス初期化されたネットワークよりも速く収束し、より高いテスト精度に到達した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。