Skip to main content
QUICK REVIEW

[论文解读] Positive-Negative Momentum: Manipulating Stochastic Gradient Noise to Improve Generalization

Zeke Xie, Yuan Li|arXiv (Cornell University)|Mar 31, 2021
Stochastic Gradient Optimization Techniques参考文献 58被引用 6
一句话总结

该论文提出了一种新型优化方法——正负动量(PNM),通过维持两个独立的动量项并利用其差值来控制随机梯度噪声(SGN)的大小,从而增强深度学习中的SGN。PNM在计算开销极低的情况下,显著提升了SGD和Adam的泛化性能,在图像分类、语言建模和噪声标签学习等基准测试中均优于传统的基于动量的优化器。

ABSTRACT

It is well-known that stochastic gradient noise (SGN) acts as implicit regularization for deep learning and is essentially important for both optimization and generalization of deep networks. Some works attempted to artificially simulate SGN by injecting random noise to improve deep learning. However, it turned out that the injected simple random noise cannot work as well as SGN, which is anisotropic and parameter-dependent. For simulating SGN at low computational costs and without changing the learning rate or batch size, we propose the Positive-Negative Momentum (PNM) approach that is a powerful alternative to conventional Momentum in classic optimizers. The introduced PNM method maintains two approximate independent momentum terms. Then, we can control the magnitude of SGN explicitly by adjusting the momentum difference. We theoretically prove the convergence guarantee and the generalization advantage of PNM over Stochastic Gradient Descent (SGD). By incorporating PNM into the two conventional optimizers, SGD with Momentum and Adam, our extensive experiments empirically verified the significant advantage of the PNM-based variants over the corresponding conventional Momentum-based optimizers.

研究动机与目标

  • 为解决人工随机噪声在提升泛化性能方面的局限性,后者无法复现真实随机梯度噪声(SGN)的各向异性和参数依赖特性。
  • 开发一种低成本、高效的SGN增强方法,且无需修改学习率或批量大小,以避免计算与收敛性之间的权衡。
  • 为SGD和Adam等优化器中的传统动量提供理论基础扎实且实证稳健的替代方案。
  • 提升深度神经网络训练中对学习率和权重衰减等超参数的泛化性能与鲁棒性。

提出的方法

  • 提出正负动量(PNM)作为传统动量的替代方案,采用两个独立的动量项,其差值可调。
  • 两个动量项之间的差值显式控制SGN的大小,从而实现对梯度噪声的精准调控,以提升泛化性能。
  • 将该方法集成到现有优化器(如SGD with Momentum和Adam)中,形成基于PNM的变体,且不改变学习率或批量大小。
  • 理论分析证明,与标准SGD相比,PNM在收敛性和泛化性能方面具有优势,尤其有利于寻找更平坦的极小值。
  • 在实践中,PNM以随机PNM和AdaPNM的形式应用,通过超参数调优以增强SGN,同时保持训练稳定性。
  • 该方法设计为即插即用,兼容主流优化器如Adam、AdamW和AMSGrad。

实验结果

研究问题

  • RQ1对动量动力学进行简单修改,能否有效增强随机梯度噪声(SGN)以提升深度学习的泛化性能?
  • RQ2所提出的正负动量方法是否在测试准确率和鲁棒性方面优于传统的基于动量的优化器?
  • RQ3PNM是否能在无需超参数调优的情况下,在多种数据集(CIFAR-10、CIFAR-100、ImageNet)和任务(图像分类、语言建模、噪声标签学习)上保持优异性能?
  • RQ4PNM对关键超参数β₀的敏感性如何?其在学习率和权重衰减变化下是否表现出鲁棒性?

主要发现

  • 基于PNM的优化器相比其传统的基于动量的对应方法,显著提升了泛化性能,在CIFAR-10上标签噪声达40%时,测试误差最高降低20个百分点。
  • 在CIFAR-10上使用ResNet18时,PNM实现4.48% ± 0.09的测试误差,优于SGD(5.01% ± 0.03)和Adam(6.53% ± 0.03)。
  • 在ImageNet上,随机PNM在所有学习率衰减阶段均持续优于SGD,表现出更快的收敛速度和更好的泛化性能。
  • AdaPNM在语言建模任务中优于Adam,展现出更高的测试性能和更快的训练速度。
  • PNM对学习率和权重衰减表现出鲁棒性,其最优超参数的稳定区域显著宽于SGD。
  • 当β₀ > 0时,PNM对β₀具有鲁棒性,可在广泛取值范围内保持优异性能;而当β₀ ≤ 0时性能下降,与理论预期一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。