Skip to main content
QUICK REVIEW

[论文解读] Neural collapse with unconstrained features

Dustin G. Mixon, Hans Parshall|arXiv (Cornell University)|Nov 23, 2020
Neural Networks and Applications被引用 7
一句话总结

本文提出一种无约束特征模型,以解释深度学习中的神经坍缩现象,表明经验风险上的梯度下降自然导致强神经坍缩——即特征坍缩为类别均值,类别中心形成正交等角框架,分类器与特征结构对齐。关键结果是:该模型中经验风险的全局最小值精确表现出强神经坍缩,从而解释了其从优化动力学中涌现的原因。

ABSTRACT

Neural collapse is an emergent phenomenon in deep learning that was recently discovered by Papyan, Han and Donoho. We propose a simple "unconstrained features model" in which neural collapse also emerges empirically. By studying this model, we provide some explanation for the emergence of neural collapse in terms of the landscape of empirical risk.

研究动机与目标

  • 解释为何尽管理论理解有限,神经坍缩仍会在深度学习中出现。
  • 在一种简化且无约束特征的模型中研究神经坍缩,其中特征不受神经网络架构的限制。
  • 识别梯度下降动力学中的一个不变子空间,该子空间促进收敛至强神经坍缩。
  • 通过精确刻画全局最小值,正式建立经验风险最小化与强神经坍缩几何结构之间的联系。

提出的方法

  • 提出一种无约束特征模型,其中特征映射 h 是从输入空间到 R^p 的任意函数,消除了架构约束。
  • 在 (H, W, b) 上定义一个梯度流系统,以经验风险 R_e(H, W, b) 作为目标函数。
  • 识别一个初始条件的子空间 S,使得梯度流在该子空间上保持不变,并收敛至强神经坍缩。
  • 使用谱分解和奇异值分析,追踪 W(t)、H(t) 和 b(t) 随时间的演化。
  • 推导出 R_e(H, W, b) 关于 W^T W 和 b 的精确表达式,表明当且仅当强神经坍缩成立时,该函数被最小化。
  • 证明在约束 (H, W, b) ∈ S 下,R_e 的全局最小值恰好是表现出强神经坍缩的那些点。
Figure 2: Gradient descent maintains small distance from the invariant subspace $S$ . Run gradient decent to minimize $R_{e}(H,W,b)$ for $C=N=3$ and $p=15$ , initializing at a random choice of $H_{0}$ and $W_{0}$ with $\|H_{0}\|_{F}=\|W_{0}\|_{F}=\varepsilon$ and $b_{0}=0$ . At each iteration, quant
Figure 2: Gradient descent maintains small distance from the invariant subspace $S$ . Run gradient decent to minimize $R_{e}(H,W,b)$ for $C=N=3$ and $p=15$ , initializing at a random choice of $H_{0}$ and $W_{0}$ with $\|H_{0}\|_{F}=\|W_{0}\|_{F}=\varepsilon$ and $b_{0}=0$ . At each iteration, quant

实验结果

研究问题

  • RQ1为何在过参数化的深度学习模型中,神经坍缩会在终端训练阶段出现?
  • RQ2一个不包含架构约束的简化模型是否仍能再现神经坍缩现象?
  • RQ3梯度下降的动力系统具有何种性质会导致强神经坍缩?
  • RQ4是否存在经验风险最小化与神经坍缩几何结构之间的直接联系?
  • RQ5在无约束设定下,梯度流在何种条件下收敛至强神经坍缩?

主要发现

  • 无约束特征模型在实验中表现出强神经坍缩,证实架构约束并非该现象出现的必要条件。
  • 梯度流动力学中存在一个不变子空间 S,使得任意初始化在 S 中均会收敛至强神经坍缩。
  • 梯度流的极限满足强神经坍缩条件:特征坍缩(SNC1)、单纯形 ETF 结构(SNC2)和自对偶性(SNC3)。
  • 经验风险 R_e(H, W, b) 恰好在 (H, W, b) 表现出强神经坍缩时被最小化,建立了优化与几何结构之间的直接联系。
  • 在约束 (H, W, b) ∈ S 下,R_e 的全局最小值恰好是满足强神经坍缩的那些点,证明该现象在该模型中是最优的。
  • 当 t → ∞ 时,W(t) 的极限与 W_0 的非零空间上的投影成正比,且 G(t) 的极限为 √N 倍于 1_C 的正交补空间上的投影,证实了单纯形结构的出现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。