Skip to main content
QUICK REVIEW

[論文レビュー] Taylorized Training: Towards Better Approximation of Neural Network Training at Finite Width

Yu Bai, Ben Krause|arXiv (Cornell University)|Feb 10, 2020
Stochastic Gradient Optimization Techniques参考文献 40被引用数 12
ひとこと要約

この論文は、ニューラルネットワークの出力を初期化の周囲でk次までのテイラー多項式に展開することで、ネットワークの訓練を近似する「テイラー化トレーニング」を導入する。実験的に、特に4次までの高次のテイラー化モデルが、線形化トレーニングを著しく上回り、重み空間および関数空間において、有限幅のニューラルネットワークの訓練をよりよく再現することを示している。標準的なトレーニング環境下でCIFAR-10において、性能差を70〜80%まで縮小している。

ABSTRACT

We propose \emph{Taylorized training} as an initiative towards better understanding neural network training at finite width. Taylorized training involves training the $k$-th order Taylor expansion of the neural network at initialization, and is a principled extension of linearized training---a recently proposed theory for understanding the success of deep learning. We experiment with Taylorized training on modern neural network architectures, and show that Taylorized training (1) agrees with full neural network training increasingly better as we increase $k$, and (2) can significantly close the performance gap between linearized and full training. Compared with linearized training, higher-order training works in more realistic settings such as standard parameterization and large (initial) learning rate. We complement our experiments with theoretical results showing that the approximation error of $k$-th order Taylorized models decay exponentially over $k$ in wide neural networks.

研究の動機と目的

  • 大規模な学習率と有限な幅が一般的な実用的ディープラーニングの文脈において、線形化トレーニングの限界を解消すること。
  • 有限幅のニューラルネットワークにおいて、高次のテイラー展開が完全なネットワークトレーニングのダイナミクスをよりよく近似できるかを調査すること。
  • 実用的設定下で、線形化モデルと完全にトレーニングされたネットワークの間の性能差を縮小すること。
  • テイラー化トレーニングを、層の重要性やパラメータの移動に関する神経ネットワーク挙動の分析ツールとしての有用性を検討すること。

提案手法

  • ニューラルネットワークの出力fθ(x)を初期化θ₀の周囲でテイラー級数展開し、k次までの多項式にまで拡張する:f^{(k)}_{θ;θ₀}(x) = f_{θ₀}(x) + Σ_{j=1}^k [∇^j_θ f_{θ₀}(x) / j!] ⋅ (θ−θ₀)^⊗j。
  • テイラー化トレーニングは、完全なネットワークfθ(x)の代わりに、k次テイラー近似f^{(k)}_{θ;θ₀}(x)を明示的に訓練することを意味する。
  • このアプローチは、標準的なパrameterizationと大きな初期学習率を用いた実用的条件下での標準アーキテクチャ(例:ResNet、CNN)に適用される。
  • 近似の質は、異なるk値に対して、完全なトレーニングとテイラー化トレーニングの間で、トレーニング軌道、テスト精度、パラメータ移動の比較を通じて評価される。
  • 理論的分析により、k次モデルの近似誤差は、広いネットワークではkが増加するにつれて指数関数的に減少することが示された。
  • 層の重要性は、テイラー化トレーニング下での各層のパラメータ更新の大きさを分析することで調査された。

実験結果

リサーチクエスチョン

  • RQ1有限幅のニューラルネットワークにおいて、線形化モデルに比べて高次のテイラー化モデルが、完全なニューラルネットワークトレーニングをよりよく近似できるか?
  • RQ2大きな学習率と標準パrameterizationを伴う実用的設定下で、テイラー化トレーニングはどのように性能を示すか?
  • RQ3テイラー展開の次数kを増加させることで、線形化トレーニングと完全トレーニングの間の性能差はどの程度縮小されるか?
  • RQ4テイラー化トレーニングは、層の重要性やパラメータ移動ダイナミクスに関する知見を明らかにできるか?
  • RQ5広いネットワークにおいて、k次モデルの近似誤差はkの増加に伴い指数関数的に減少するか?

主な発見

  • CIFAR-10において、k=4(4次)のテイラー化トレーニングは、線形化トレーニングと完全トレーニングの間のテスト精度差を70〜80%縮小し、完全トレーニングより10〜15%低い性能にとどまる。
  • 高次のテイラー化モデル(k≥2)は、大きな学習率下でも、パラメータ空間および関数空間の両方で、完全トレーニングの軌道を次第に良く再現する。
  • 4次テイラー化モデルは、通常完全トレーニングと比べて40%以上の精度低下を示す線形化トレーニングよりも著しく優れている。
  • 理論的分析により、近似誤差が広いニューラルネットワークにおいてkが増加するにつれて指数関数的に減少することが確認され、実験的傾向を裏付けた。
  • テイラー化トレーニングにより、深層部の層は浅層部の層よりも移動が少ないことが明らかになり、層の重要性の階層的構造が示唆された。
  • 特に標準的なハイパーパrameter設定下では、線形化トレーニングに比べ、有限幅のトレーニングダイナミクスをより現実的にモデル化できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。