Skip to main content
QUICK REVIEW

[論文レビュー] Neural Collapse Under MSE Loss: Proximity to and Dynamics on the Central Path

X. Y. Han, Vardan Papyan|arXiv (Cornell University)|Jun 3, 2021
Domain Adaptation and Few-Shot Learning参考文献 33被引用数 19
ひとこと要約

この論文は、平均二乗誤差(MSE)損失で訓練された深層ネットワークにおけるニューラルコラプス(NC)を調査し、交差エントロピー(CE)損失での訓練と同様にNCが出現することを示している。MSE損失をNCに関連する項と、それとは乖離する項に分解し、分類器がMSE最適のまま保たれる理論的軌道「中央経路(central path)」を導入することで、NCの出現を予測する正確な勾配フロー動的を導出。これにより、NCの出現を理解するための数学的に取り扱いやすい枠組みが得られる。

ABSTRACT

The recently discovered Neural Collapse (NC) phenomenon occurs pervasively in today's deep net training paradigm of driving cross-entropy (CE) loss towards zero. During NC, last-layer features collapse to their class-means, both classifiers and class-means collapse to the same Simplex Equiangular Tight Frame, and classifier behavior collapses to the nearest-class-mean decision rule. Recent works demonstrated that deep nets trained with mean squared error (MSE) loss perform comparably to those trained with CE. As a preliminary, we empirically establish that NC emerges in such MSE-trained deep nets as well through experiments on three canonical networks and five benchmark datasets. We provide, in a Google Colab notebook, PyTorch code for reproducing MSE-NC and CE-NC: at https://colab.research.google.com/github/neuralcollapse/neuralcollapse/blob/main/neuralcollapse.ipynb. The analytically-tractable MSE loss offers more mathematical opportunities than the hard-to-analyze CE loss, inspiring us to leverage MSE loss towards the theoretical investigation of NC. We develop three main contributions: (I) We show a new decomposition of the MSE loss into (A) terms directly interpretable through the lens of NC and which assume the last-layer classifier is exactly the least-squares classifier; and (B) a term capturing the deviation from this least-squares classifier. (II) We exhibit experiments on canonical datasets and networks demonstrating that term-(B) is negligible during training. This motivates us to introduce a new theoretical construct: the central path, where the linear classifier stays MSE-optimal for feature activations throughout the dynamics. (III) By studying renormalized gradient flow along the central path, we derive exact dynamics that predict NC.

研究の動機と目的

  • 平均二乗誤差(MSE)損失で訓練された深層ネットワークにおいて、ニューラルコラプス(NC)が交差エントロピー(CE)損失と同様に発現することを確立すること。
  • MSE損失を、NCと関連する解釈可能な項と、NCと一致しない項に分解し、それぞれを区別すること。
  • 分類器が訓練の各ステップで特徴量活性化に対してMSE最適のまま保たれる理論的構造「中央経路」を導入し、正確な動的解析を可能にすること。
  • 中央経路上での正確な勾配フロー動的を導出し、NCの出現を予測することにより、NCの数学的・厳密な基礎を提供すること。

提案手法

  • MSE損失を、(A) 分類器が最小二乗法分類器である場合にNC理論で解釈可能な項、および (B) その理想化された分類器からのずれを表す項に分解すること。
  • 実験的に、標準的なネットワークとデータセットで訓練を行う過程において、項(B)が無視できるほど小さいことを示し、中央経路近似の妥当性を裏付けること。
  • 中央経路を、各訓練ステップにおける特徴量活性化に対して分類器がMSE最適のまま保たれる軌道として定義すること。
  • 中央経路上での正規化された勾配フローを分析し、NCへの収束を支配する正確な動的を導出すること。
  • 中央経路と正規化された動的を用いて、NCの極限的挙動(特徴量崩壊、正単体ETFへの収束、分類器の整合性)を解析的に予測すること。
  • MSE損失の解析的扱いやすさを活かし、複雑なCE損失よりも容易に取り扱えるNCの理論的枠組みを提供すること。

実験結果

リサーチクエスチョン

  • RQ1平均二乗誤差(MSE)損失で訓練された深層ネットワークにおいて、交差エントロピー(CE)損失と同様にニューラルコラプスが出現するか?
  • RQ2MSE損失を、ニューラルコラプスのメカニズムを直接反映する成分に分解できるか?
  • RQ3分類器がMSE最適のまま保たれる理論的軌道(例:「中央経路」)が存在するか? これによりNCの正確な動的解析が可能か?
  • RQ4中央経路上での正確な勾配フロー動的は、ニューラルコラプスへの収束を予測できるか?
  • RQ5MSE訓練下でのNC出現の数学的条件は何か? それらはCEベースの訓練とどのように比較できるか?

主な発見

  • MSE損失で訓練された深層ネットワークにおいて、3つの標準的アーキテクチャと5つのベンチマークデータセットでニューラルコラプスが出現し、CE訓練に限らない強靭性を確認した。
  • MSE損失は、分類器が最小二乗法最適である場合にNCと整合する項と、わずかなずれを表す項に分解され、訓練過程で実験的に無視できるほど小さいことが示された。
  • 中央経路は、分類器が訓練全体を通じてMSE最適のまま保たれる理論的構造として導入され、正確な動的解析を可能にした。
  • 中央経路上での正規化された勾配フローから導出された正確な動的は、ニューラルコラプスへの収束(特徴量崩壊、正単体ETFへの整合)を予測した。
  • MSE損失に基づく理論的枠組みは、複雑なCE損失よりも解析的に取り扱いやすく、NC出現の正確な導出を可能にした。
  • 結果から、NCはCE損失に起因する現象ではなく、標準的最適化下で過パラメータ化された深層学習の根本的性質である可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。