Skip to main content
QUICK REVIEW

[论文解读] An Unconstrained Layer-Peeled Perspective on Neural Collapse

Wenlong Ji, Yiping Lu|arXiv (Cornell University)|Oct 6, 2021
Stochastic Gradient Optimization Techniques参考文献 47被引用 11
一句话总结

本文提出了无约束层剥离模型(ULPM),作为神经网络的代理模型,该模型去除了显式的特征约束或正则化。研究证明,ULPM上的梯度流会收敛到全局最小值点,这些最小值点表现出神经坍缩现象——即最后一层特征坍缩为类别均值并形成等角紧框架,这是由于交叉熵损失的良性全局景观所致,该景观确保除神经坍缩解外的所有临界点均为严格鞍点。

ABSTRACT

Neural collapse is a highly symmetric geometric pattern of neural networks that emerges during the terminal phase of training, with profound implications on the generalization performance and robustness of the trained networks. To understand how the last-layer features and classifiers exhibit this recently discovered implicit bias, in this paper, we introduce a surrogate model called the unconstrained layer-peeled model (ULPM). We prove that gradient flow on this model converges to critical points of a minimum-norm separation problem exhibiting neural collapse in its global minimizer. Moreover, we show that the ULPM with the cross-entropy loss has a benign global landscape for its loss function, which allows us to prove that all the critical points are strict saddle points except the global minimizers that exhibit the neural collapse phenomenon. Empirically, we show that our results also hold during the training of neural networks in real-world tasks when explicit regularization or weight decay is not used.

研究动机与目标

  • 理解深度学习中梯度下降的隐式偏差,该偏差导致在无显式正则化条件下出现神经坍缩。
  • 分析神经坍缩是否本质上由交叉熵损失与梯度流的优化动力学所引发。
  • 构建一个去除特征约束或正则化的理论模型,以隔离优化在诱导神经坍缩中的作用。
  • 通过实证验证,神经坍缩在无权重衰减或显式约束的真实训练中确实会发生。

提出的方法

  • 提出无约束层剥离模型(ULPM),其中最后一层特征和分类器为自由优化变量,不施加范数约束。
  • 分析ULPM上使用交叉熵损失的梯度流,证明其收敛至最小范数分离问题的临界点。
  • 证明损失函数具有良性全局景观:除表现出神经坍缩的全局最小值点外,所有临界点均为严格鞍点。
  • 建立神经坍缩与最大间隔隐式正则化之间的联系,通过最小范数分离问题实现。
  • 利用切空间分析表明,仅神经坍缩解是全局最小值点,而所有其他临界点均为鞍点。
  • 在VGG和ResNet架构上对CIFAR-10、MNIST、KMNIST和Fashion-MNIST数据集进行实证验证,训练过程中不使用权重衰减。

实验结果

研究问题

  • RQ1在深度网络训练中,若无显式正则化或特征约束,神经坍缩是否仍可出现?
  • RQ2在无约束条件下,梯度流与交叉熵损失在诱导神经坍缩中起到何种作用?
  • RQ3无约束模型的损失景观是否支持收敛至神经坍缩解?
  • RQ4在无权重衰减的训练过程中,范数、类内变化和余弦相似性的动态演化如何?
  • RQ5在无约束训练下,神经坍缩现象在不同架构和真实世界数据集上是否具有鲁棒性?

主要发现

  • 在无约束层剥离模型(ULPM)上,梯度流收敛至最小范数分离问题的临界点,其全局最小值点表现出神经坍缩。
  • ULPM中的交叉熵损失具有良性全局景观:除显示神经坍缩的全局最小值点外,所有临界点均为严格鞍点。
  • 在CIFAR-10、MNIST、KMNIST和Fashion-MNIST上使用VGG和ResNet进行真实世界训练时,神经坍缩现象在无权重衰减或显式正则化条件下依然出现。
  • 实证结果表明,类内变化减小,类别均值间的余弦相似性收敛至同一数值,分类器范数趋于稳定——与神经坍缩一致。
  • 关键指标(范数、类内变化、余弦相似性、自对偶性)收敛至神经坍缩值的速率在双对数尺度下约为$O(1//log(t))$。
  • 缺乏特征约束或正则化并不会阻止神经坍缩的出现,表明其是梯度下降与交叉熵损失结合下的内在属性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。