Skip to main content
QUICK REVIEW

[論文レビュー] The Low-Rank Simplicity Bias in Deep Networks

Minyoung Huh, Hossein Mobahi|arXiv (Cornell University)|Mar 18, 2021
Sparse and Compressive Sensing Techniques参考文献 79被引用数 11
ひとこと要約

この論文は、深層ニューラルネットワークが、深さの増加に伴い、低ランクの表現に偏る低ランクシンプルネスバイアスを示すと提唱している。これは、深層アーキテクチャにおいて低ランク関数の体積が大きくなることに起因する。実験的に、深層ネットワークは、ノイズありや高ランクタスクであっても、モデル容量を変更せずに低ランク表現に暗黙的にバイアスをかけるため、CIFARおよびImageNetにおける性能が向上し、一般化性能が向上することが示された。

ABSTRACT

Modern deep neural networks are highly over-parameterized compared to the data on which they are trained, yet they often generalize remarkably well. A flurry of recent work has asked: why do deep networks not overfit to their training data? In this work, we make a series of empirical observations that investigate and extend the hypothesis that deeper networks are inductively biased to find solutions with lower effective rank embeddings. We conjecture that this bias exists because the volume of functions that maps to low effective rank embedding increases with depth. We show empirically that our claim holds true on finite width linear and non-linear models on practical learning paradigms and show that on natural data, these are often the solutions that generalize well. We then show that the simplicity bias exists at both initialization and after training and is resilient to hyper-parameters and learning methods. We further demonstrate how linear over-parameterization of deep non-linear models can be used to induce low-rank bias, improving generalization performance on CIFAR and ImageNet without changing the modeling capacity.

研究の動機と目的

  • 過パラメータ化された深層ネットワークが、高い容量にもかかわらず一般化性能を示す理由を調査し、古典的な過学習の期待を疑問視する。
  • 深さが線形および非線形モデルの両方において低ランク解へのバイアスを引き起こすかどうかを検証する。
  • この低ランクバイアスが、初期化、学習、ハイパーパrameter、学習手法にかかわらず持続するかどうかをテストする。
  • 線形過パラメータ化を用いて、モデルの表現能力を変更せずに低ランクバイアスを誘発し、一般化性能を向上させることの可能性を検討する。
  • ノイズのある教師信号およびラベルの損傷下でも、シンプルネスバイアスのロバスト性を評価する。

提案手法

  • ランク(1〜64)と深さ(1〜20層)を変化させた線形回帰タスクにおいて、訓練損失とテスト損失を実証的に評価し、ゼロ損失への収束を測定する。
  • 特徴量の有効ランクを特徴量埋め込みの特異値分解(SVD)を用いて計算し、学習された表現のランクを定量化する。
  • 非線形モデルに線形過パラメータ化を適用して低ランクバイアスを誘発し、CIFAR-10およびImageNetにおける性能を評価する。
  • 静的および確率的ノイズを注入したノイズあり最小二乗法実験を実施し、ラベル汚染下での低ランクバイアスのロバスト性をテストする。
  • ランダムネットワークサンプリングを用いて、深層線形モデルにおける重み行列のランクとカーネル(グラム行列)のランクの関係を分析する。
  • 学習率スケジューリングを適用したSGDを用い、複数のノイズレベルと深さでモデルを学習し、テスト性能と有効ランクを比較する。

実験結果

リサーチクエスチョン

  • RQ1高ランク線形関数(ランク64)をフィッティングする際でさえ、深さの増加が低有効ランク解へのバイアスを引き起こすか?
  • RQ2低ランクシンプルネスバイアスはネットワークの初期化段階に存在し、異なる最適化手法やハイパーパrameterを経ても維持されるか?
  • RQ3非線形モデルにおける線形過パラメータ化を用いて、モデル容量を変更せずに低ランクバイアスを誘発し、一般化性能を向上させることができるか?
  • RQ4静的ノイズと確率的ノイズの両方の下で、低ランクバイアスが一般化性能に与える影響は何か?
  • RQ5深層線形モデルにおける重み行列の有効ランクとカーネル(グラム行列)の有効ランクの関係は何か?

主な発見

  • 深層ネットワークは高ランク線形関数(ランク64)をフィッティングできず、深さが増すほど訓練損失が増加する一方、浅層ネットワークはゼロ損失に収束する。
  • 深層ネットワークにおける特徴量埋め込みの有効ランクは、浅層ネットワークと比較して一貫して低く、系統的な低ランクバイアスが存在することが示された。
  • 低ランクシンプルネスバイアスは初期化段階から存在し、異なる最適化手法、学習率、ハイパーパrameterを経ても維持され、ロバストである。
  • ノイズあり最小二乗法実験では、深層ネットワークは浅層ネットワークよりも一般化性能が優れており、ノイズに過剰に適合せず、特に確率的ノイズ下で低いテスト誤差を達成する。
  • ノイズのある観測下でも、深層ネットワークは低有効ランクの解に収束する傾向があり、深さがラベルノイズに対する正則化として機能することが示唆された。
  • 深層線形モデルにおいて、重み行列の有効ランクとグラム行列の有効ランクの間に強い線形関係が存在し、重みとカーネルのランクの理論的関連性を裏付けるものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。