Skip to main content
QUICK REVIEW

[论文解读] An Empirical Study of Large-Batch Stochastic Gradient Descent with Structured Covariance Noise

Yeming Wen, Kevin Luk|arXiv (Cornell University)|Feb 21, 2019
Stochastic Gradient Optimization Techniques参考文献 65被引用 12
一句话总结

本文提出在大规模小批量随机梯度下降(SGD)中引入结构化协方差噪声——具体为对角线Fisher噪声——以提升泛化性能,同时不牺牲优化速度。通过利用噪声结构而非仅方差,该方法在大规模小批量训练中实现了小批量训练的泛化性能,实证结果表明其收敛速度更快,且测试准确率与小批量SGD相当。

ABSTRACT

The choice of batch-size in a stochastic optimization algorithm plays a substantial role for both optimization and generalization. Increasing the batch-size used typically improves optimization but degrades generalization. To address the problem of improving generalization while maintaining optimal convergence in large-batch training, we propose to add covariance noise to the gradients. We demonstrate that the learning performance of our method is more accurately captured by the structure of the covariance matrix of the noise rather than by the variance of gradients. Moreover, over the convex-quadratic, we prove in theory that it can be characterized by the Frobenius norm of the noise matrix. Our empirical studies with standard deep learning model-architectures and datasets shows that our method not only improves generalization performance in large-batch training, but furthermore, does so in a way where the optimization performance remains desirable and the training duration is not elongated.

研究动机与目标

  • 解决大规模小批量SGD训练中的泛化差距问题,即更大的小批量虽能提升优化效率但会损害泛化性能。
  • 探究梯度更新中的噪声结构(而不仅仅是方差)是否能更准确地刻画优化行为。
  • 开发一种噪声注入方法,在保持快速收敛的同时提升大规模小批量设置下的泛化性能。
  • 证明对角线Fisher噪声相较于完整Fisher噪声或各向同性噪声,在泛化与优化速度之间提供了更优的权衡。
  • 建立噪声协方差结构与非凸深度学习设置下收敛性之间的理论与实证联系。

提出的方法

  • 提出在大规模小批量SGD更新中注入协方差结构源自Fisher信息矩阵对角线的梯度噪声。
  • 利用对数似然损失下的Fisher信息矩阵,将小批量与大规模小批量梯度之间的差异建模为噪声。
  • 用对角线Fisher噪声替代完整Fisher噪声,以降低计算成本并提升收敛速度。
  • 理论分析表明,在凸二次设置下,收敛性由噪声协方差矩阵的Frobenius范数表征。
  • 在标准深度学习模型(如CIFAR-10上的ResNet44)上,通过固定训练轮数对方法进行实证验证。
  • 与基线方法进行对比:小批量SGD、大规模小批量SGD、大规模小批量加各向同性噪声,以及大规模小批量加完整Fisher噪声。

实验结果

研究问题

  • RQ1具有特定协方差矩阵的结构化噪声是否能在不降低优化速度的前提下,改善大规模小批量SGD的泛化性能?
  • RQ2仅依赖梯度方差是否足以预测优化行为,还是噪声结构起着更关键的作用?
  • RQ3在大规模小批量训练中,噪声协方差的选择(特别是对角线Fisher与完整Fisher)如何影响收敛性与泛化性能?
  • RQ4对角线Fisher噪声是否能实现与小批量SGD相当的泛化性能,同时保持大规模小批量训练的效率?
  • RQ5在非凸深度学习问题中,噪声协方差结构与收敛性之间存在何种理论关系?

主要发现

  • 采用对角线Fisher噪声的大规模小批量SGD在相同训练轮数内,实现了与小批量SGD相当的泛化性能。
  • 尽管梯度方差较高,但采用对角线Fisher噪声的大规模小批量训练收敛速度显著快于完整Fisher噪声。
  • 完整Fisher噪声导致收敛速度极慢,即使在8000次参数更新后仍不切实际,难以用于大规模小批量训练。
  • 理论分析表明,在凸二次设置下,收敛性由噪声协方差矩阵的Frobenius范数表征。
  • 实证结果证实,在非凸深度学习设置下,噪声矩阵的Frobenius范数仍是优化行为的强预测因子。
  • 对角线Fisher噪声在泛化与收敛速度的平衡方面,优于各向同性高斯噪声和完整Fisher噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。