Skip to main content
QUICK REVIEW

[論文レビュー] Directional convergence and alignment in deep learning

Ziwei Ji, Matus Telgarsky|arXiv (Cornell University)|Jun 11, 2020
Stochastic Gradient Optimization Techniques参考文献 34被引用数 14
ひとこと要約

この論文は、深層同次的ニューラルネットワークにおける勾配フローが、重みの発散にもかかわらず方向に収束することを確立し、予測、マージン、一般化関連量の収束を保証する。主な結果は、幅や初期化の制約なしに適用可能な、定義可能関数に対する非有界で滑らかでないKurdyka-Łojasiewicz不等式の新理論に依拠している。唯一必要な条件は完璧な分類である。

ABSTRACT

In this paper, we show that although the minimizers of cross-entropy and related classification losses are off at infinity, network weights learned by gradient flow converge in direction, with an immediate corollary that network predictions, training errors, and the margin distribution also converge. This proof holds for deep homogeneous networks -- a broad class of networks allowing for ReLU, max-pooling, linear, and convolutional layers -- and we additionally provide empirical support not just close to the theory (e.g., the AlexNet), but also on non-homogeneous networks (e.g., the DenseNet). If the network further has locally Lipschitz gradients, we show that these gradients also converge in direction, and asymptotically align with the gradient flow path, with consequences on margin maximization, convergence of saliency maps, and a few other settings. Our analysis complements and is distinct from the well-known neural tangent and mean-field theories, and in particular makes no requirements on network width and initialization, instead merely requiring perfect classification accuracy. The proof proceeds by developing a theory of unbounded nonsmooth Kurdyka-Łojasiewicz inequalities for functions definable in an o-minimal structure, and is also applicable outside deep learning.

研究の動機と目的

  • 重みが発散しても予測面の不安定さや一般化に関する懸念を解消すること。
  • 特に完璧な分類という最小限の仮定のもとで、ネットワークパラメータの方向収束を確立すること。
  • 勾配が局所リプシッツ連続である場合に、勾配とサリエンシー・マップの収束を拡張すること。
  • 幅や初期化の制約なしに、ニューラルトランジェント理論や平均場理論に依存しない理論的枠組みを提供すること。

提案手法

  • o-最小構造で定義可能な関数に対する非有界で滑らかでないKurdyka-Łojasiewicz(KŁ)不等式の理論を構築する。
  • クロージャー部分微分を用いて、交差エントロピーのような非微分可能かつ非凸な損失関数の勾配フローを分析する。
  • L-正同次性と定義可能性の下で、正規化された重み軌道が有限長であることを証明し、これにより方向収束が導かれる。
  • KŁフレームワークを適用して、勾配が局所リプシッツ連続である場合に、勾配もパラメータの経路に沿って方向収束することを示し、マージン最大化とサリエンシー・マップの収束を可能にする。
  • 同次的(例:変更版AlexNet)および非同次的(例:DenseNet)ネットワークにおいて、方向収束の実験的妥当性を検証する。
  • 測度分割とリプシッツ連続性を用いて、時間経過に伴うマージンおよび予測値のずれを評価する。

実験結果

リサーチクエスチョン

  • RQ1深層同次的ネットワークにおける勾配フローは、重みが無限大に発散する中でも方向に収束するのか?
  • RQ2広いネットワークや初期化の小さな摂動を要件としないで、方向収束を確立できるか?
  • RQ3勾配が局所リプシッツ連続である場合、勾配も方向に収束するのか? その場合のマージン最大化への影響は何か?
  • RQ4この理論は、スキップ接続やバイアスを有するネットワーク、特に同次的でないネットワークへも拡張可能か?
  • RQ5この提案されたKŁ不等式フレームワークは、ニューラルトランジェント理論や平均場理論と比較して、仮定や範囲においてどのように異なるか?

主な発見

  • 正規化された重み軌道 $ \frac{W_t}{\|W_t\|} $ が収束し、ネットワークパラメータの方向収束が示唆される。
  • 予測マージン $ \frac{y_i \Phi(x_i; W_t)}{\|W_t\|^L} $ が収束し、一般化関連量の安定性が保証される。
  • 勾配が局所リプシッツ連続である場合、勾配はパラメータの経路に沿って方向収束し、サリエンシー・マップの収束とマージン最大化が可能になる。
  • この理論は、ReLU、マックスプーリング、線形、畳み込み層を含む深層ネットワークに、同次性と定義可能性の仮定のみで適用可能である。
  • 実験的結果により、同次的(例:変更版AlexNet)および非同次的(例:DenseNet)アーキテクチャにおいても方向収束が確認された。
  • このフレームワークはニューラルトランジェント理論や平均場理論に依存せず、完璧な分類のみを仮定し、幅や初期化の制約なしに成立する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。