[论文解读] Interplay Between Optimization and Generalization of Stochastic Gradient Descent with Covariance Noise.
本文提出在随机梯度下降(SGD)的梯度中添加协方差噪声,以在不牺牲优化速度的前提下提升大批次训练中的泛化性能。研究表明,噪声的结构——特别是其弗罗贝尼乌斯范数——比梯度方差更能准确捕捉性能表现,并通过实证验证表明,该方法在保持快速收敛的同时增强了泛化能力。
The choice of batch-size in a stochastic optimization algorithm plays a substantial role for both optimization and generalization. Increasing the batch-size used typically improves optimization but degrades generalization. To address the problem of improving generalization while maintaining optimal convergence in large-batch training, we propose to add covariance noise to the gradients. We demonstrate that the learning performance of our method is more accurately captured by the structure of the covariance matrix of the noise rather than by the variance of gradients. Moreover, over the convex-quadratic, we prove in theory that it can be characterized by the Frobenius norm of the noise matrix. Our empirical studies with standard deep learning model-architectures and datasets shows that our method not only improves generalization performance in large-batch training, but furthermore, does so in a way where the optimization performance remains desirable and the training duration is not elongated.
研究动机与目标
- 为解决大批次随机梯度下降(SGD)中优化效率与泛化性能之间的权衡问题。
- 探究结构化噪声——特别是协方差噪声——是否能在不降低优化速度的前提下改善泛化性能。
- 确定噪声SGD的性能是否更应由噪声的协方差结构而非其梯度方差来表征。
- 在理论和实证层面验证,在凸二次问题设置下,噪声矩阵的弗罗贝尼乌斯范数能够捕捉学习性能。
- 证明所提出的方法在标准深度学习模型中可保持快速收敛,同时提升测试准确率。
提出的方法
- 通过在SGD的梯度更新中添加一个噪声矩阵来引入协方差噪声,其中噪声矩阵来自具有指定协方差结构的分布。
- 设计噪声矩阵,使其协方差结构能直接影响参数空间中的更新方向和方差。
- 理论分析聚焦于凸二次问题,证明泛化性能由噪声矩阵的弗罗贝尼乌斯范数表征。
- 实证评估在基准数据集(如CIFAR-10、ImageNet)上使用标准深度学习架构(如ResNet、VGG)进行,采用不同批量大小。
- 在训练过程中以受控的协方差添加噪声,并以测试准确率和收敛速度衡量性能。
- 将该方法与标准SGD及其他噪声注入技术进行比较,并开展关于噪声方差和结构的消融研究。
实验结果
研究问题
- RQ1在SGD梯度中添加协方差噪声是否能在不减慢收敛速度的前提下提升大批次训练中的泛化性能?
- RQ2噪声SGD的性能是否更佳地由噪声的协方差结构而非其梯度方差来预测?
- RQ3在凸二次问题中,噪声矩阵的弗罗贝尼乌斯范数是否能表征学习性能?
- RQ4所提出的方法是否在保持快速优化动力学的同时,提升了标准深度学习设置下的测试准确率?
- RQ5与各向同性噪声相比,噪声矩阵的结构在泛化增益方面表现如何?
主要发现
- 添加协方差噪声显著提升了大批次SGD的泛化性能,使性能达到与小批次训练相当的水平。
- 在凸二次问题中,噪声矩阵的弗罗贝尼乌斯范数比梯度方差更能准确捕捉泛化性能。
- 理论分析证实,在凸二次设置下,噪声矩阵的弗罗贝尼乌斯范数能够表征学习性能。
- 实证结果表明,该方法保持了快速收敛,即使在大批次设置下也未增加训练时长。
- 在多种架构和数据集上,该方法的测试准确率均高于标准SGD及其他噪声注入基线方法。
- 噪声矩阵的结构——特别是其协方差——在提升泛化性能方面比各向同性噪声更为有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。