Skip to main content
QUICK REVIEW

[論文レビュー] Explicit regularization and implicit bias in deep network classifiers trained with the square loss

Tomaso Poggio, Qianli Liao|arXiv (Cornell University)|Dec 31, 2020
Stochastic Gradient Optimization Techniques参考文献 10被引用数 7
ひとこと要約

この論文は、平方損失で訓練された深層ReLUネットワークの理論的分析を提供し、ミニバッチ正則化(BN)と重み減衰(WD)が、最小ノルム解および最大マージン解への勾配フローのバイアスを引き起こす明示的正則化をもたらすことを示している。BNとWDが存在しない場合、小さな初期化からの暗黙のバイアスも依然として高マージン解を好み、ゼロの訓練損失にもかかわらず一般化が成立することを説明する。

ABSTRACT

Deep ReLU networks trained with the square loss have been observed to perform well in classification tasks. We provide here a theoretical justification based on analysis of the associated gradient flow. We show that convergence to a solution with the absolute minimum norm is expected when normalization techniques such as Batch Normalization (BN) or Weight Normalization (WN) are used together with Weight Decay (WD). The main property of the minimizers that bounds their expected error is the norm: we prove that among all the close-to-interpolating solutions, the ones associated with smaller Frobenius norms of the unnormalized weight matrices have better margin and better bounds on the expected classification error. With BN but in the absence of WD, the dynamical system is singular. Implicit dynamical regularization -- that is zero-initial conditions biasing the dynamics towards high margin solutions -- is also possible in the no-BN and no-WD case. The theory yields several predictions, including the role of BN and weight decay, aspects of Papyan, Han and Donoho's Neural Collapse and the constraints induced by BN on the network weights.

研究の動機と目的

  • 古典的な一般化理論とは対照的に、ゼロの訓練損失にもかかわらず、深層ReLUネットワークがなぜ良好に一般化するのかを説明すること。
  • このようなネットワークにおける良好なテスト性能の背後にあるメカニズム(明示的および暗黙の正則化)を同定すること。
  • ミニバッチ正則化(BN)、重み減衰(WD)、および小さな初期化が最適化ダイナミクスと一般化をどのように形作っているかを明確にすること。
  • 最適化ダイナミクスをニューラルコラプス現象と結びつけ、収束時の重み行列に課される制約を導出すること。

提案手法

  • 正則化された重み行列の単位Frobeniusノルム制約を課した、変更された平方損失における勾配フローのダイナミクスを分析する。
  • BNとWDの効果を、ラグランジュ乗数νが動的正則化子として機能する制約付き最適化問題としてモデル化する。
  • スケール要因ρと正規化された重み行列V_kへのネットワークの分解を用い、ノルムとマージンのトレードオフを分析する。
  • 臨界点が∂f(x_j)/∂V_k = V_k f(x_j)を満たす条件を導出し、ニューラルコラプスおよび重み行列の制約と関連付ける。
  • BN+WDとBNなし/WDなしのケースを比較し、前者は初期化に依存しなくても安定であるのに対し、後者は小さな初期ρに依存した暗黙のバイアスに依存することを示す。
  • 理論的結果を実際の学習に応用し、初期化依存の収束や正規化の役割を予測する。

実験結果

リサーチクエスチョン

  • RQ1ミニバッチ正則化(BN)と重み減衰(WD)を組み合わせることで、平方損失で訓練された深層ネットワークがなぜ最小ノルムかつ高マージン解に収束するのか?
  • RQ2BNとWDが存在しない場合、小さな初期化は一般化可能な解への暗黙のバイアスをどのように引き起こすのか?
  • RQ3制約付き損失関数における勾配フローのダイナミクスは、過パラメータ化されたネットワークにおけるニューラルコラプスの出現をどのように説明するのか?
  • RQ4BNとWDが欠落していると、なぜ収束が初期化に依存するようになるのか? そしてこれは一般化にどのように影響するのか?
  • RQ5最適化ダイナミクスの臨界点が重み行列の構造に課す制約は何か?

主な発見

  • BNとWDがある場合、勾配フローはグローバルな最小ノルム解に収束し、これは最大マージンであり、期待分類誤差の良い境界を与える。
  • 非正規化された重み行列のFrobeniusノルムρは、マージンと逆相関する:ρが小さいほどマージンが大きく、一般化性能が向上する。
  • BNとWDが存在しない場合、小さな初期化によっても依然として高マージン解への暗黙のバイアスが生じるが、収束は初期条件に強く依存する。
  • 臨界点で∂f(x_j)/∂V_k = V_k f(x_j)の条件が成立し、これはニューラルコラプスの主要な側面(クラス平均と特徴の崩壊)を説明する。
  • 制約付き損失におけるラグランジュ乗数νは、動的正則化子として機能し、各V_kを単位球面上に制約することで学習を安定化させる。
  • BNは重み行列を正規化するだけでなく、各行を個別に正規化するため、標準的な重み正則化よりも強い制約を課す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。