[论文解读] SGD with Large Step Sizes Learns Sparse Features
该论文表明,SGD 中较大的步长会引发损失稳定化阶段,从而在无显式正则化的情况下,使神经网络的隐式偏差趋向于稀疏特征表示。通过实验和理论分析,研究发现长期稳定化会增强噪声驱动的动力学,使 SGD 能够通过与神经正切核特征相关的 SDE 模型学习到稀疏特征。
We showcase important features of the dynamics of the Stochastic Gradient Descent (SGD) in the training of neural networks. We present empirical observations that commonly used large step sizes (i) lead the iterates to jump from one side of a valley to the other causing loss stabilization, and (ii) this stabilization induces a hidden stochastic dynamics orthogonal to the bouncing directions that biases it implicitly toward sparse predictors. Furthermore, we show empirically that the longer large step sizes keep SGD high in the loss landscape valleys, the better the implicit regularization can operate and find sparse representations. Notably, no explicit regularization is used so that the regularization effect comes solely from the SGD training dynamics influenced by the step size schedule. Therefore, these observations unveil how, through the step size schedules, both gradient and noise drive together the SGD dynamics through the loss landscape of neural networks. We justify these findings theoretically through the study of simple neural network models as well as qualitative arguments inspired from stochastic processes. Finally, this analysis allows us to shed a new light on some common practice and observed phenomena when training neural networks. The code of our experiments is available at https://github.com/tml-epfl/sgd-sparse-features.
研究动机与目标
- 理解在深度神经网络训练过程中,SGD 大步长带来的隐式正则化效应。
- 探究为何损失稳定化——一种在实践中常见现象——尽管损失不再下降,却能提升泛化性能。
- 表征稳定化阶段中促进稀疏特征学习的隐藏随机动力学。
- 将观察到的行为与具有与神经正切核特征相关的乘性噪声的随机微分方程(SDE)模型联系起来。
- 提供理论和实证依据,解释大步长如何促成从懒惰训练到丰富特征学习范式的转变。
提出的方法
- 通过分段常数步长调度策略(带与不带衰减)在 CIFAR-10 上实证分析 ResNet-18 的训练动态。
- 观察到训练损失在无进一步下降的情况下保持近似恒定的损失稳定化模式。
- 使用噪声项与神经正切核(NTK)特征成比例的随机微分方程(SDE)对稳定化期间的慢变动态进行建模。
- 通过对比预测的特征稀疏性与实际网络行为,验证 SDE 模型在 CIFAR-10 和 CIFAR-100 上多种架构(ResNet-18、ResNet-34)上的有效性。
- 采用两层教师-学生设置,确认小步长会抑制特征学习,而大步长则能实现特征学习。
- 通过分析小批量大小的影响,表明将步长替换为按批量大小 $ B $ 缩放的有效步长 $ \gamma \leftarrow \gamma / B $ 可保持动态特性不变。
实验结果
研究问题
- RQ1SGD 中的大步长在损失下降之外如何影响训练动态?
- RQ2在损失稳定化阶段,哪些隐藏的随机动力学导致了泛化性能的提升?
- RQ3在稳定化阶段,能否通过基于 NTK 的噪声的 SDE 模型来描述对稀疏特征的隐式偏差?
- RQ4稳定化阶段的持续时间在多大程度上影响所学习特征的稀疏性及泛化性能?
- RQ5常见的训练技巧如权重衰减、BatchNorm 和 SAM 如何与大步长引发的隐式正则化相关联?
主要发现
- 大步长会引发损失稳定化阶段,此时训练损失近似恒定,但随着持续时间延长,泛化性能仍会提升。
- 在稳定化阶段,SGD 展现出由梯度与非零乘性噪声相互作用驱动的缓慢漂移,该行为使模型偏向于稀疏特征表示。
- 稳定化期间的有效动态可被一个随机微分方程(SDE)良好建模,其噪声项与神经正切核(NTK)特征成比例。
- 实证结果证实,延长稳定化阶段的持续时间可提升特征稀疏性并降低测试误差,即使没有显式正则化。
- 特征稀疏性与泛化性能提升密切相关,测试误差差异可达 12–35%,具体取决于步长调度策略。
- 归一化技术如 BatchNorm 和权重衰减可被解释为使模型能够采用更大步长,从而增强对稀疏性的隐式偏差,防止发散的同时放大正则化效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。