Skip to main content
QUICK REVIEW

[论文解读] Accumulated Gradient Normalization

Joeri Hermans, Gerasimos Spanakis|arXiv (Cornell University)|Oct 6, 2017
Stochastic Gradient Optimization Techniques参考文献 2被引用 6
一句话总结

本文提出累积梯度归一化(AGN),一种分布式优化器,通过在将梯度发送至参数服务器之前对累积的一阶梯度进行归一化,从而在异步数据并行训练中提升收敛性和稳定性。通过减小梯度幅值并对齐更新方向,AGN缓解了参数滞后和隐式动量的负面影响,在高并发和通信受限条件下,其性能优于EASGD和DYN-SGD等基线方法,无论在准确率还是时间效率方面均表现更优。

ABSTRACT

This work addresses the instability in asynchronous data parallel optimization. It does so by introducing a novel distributed optimizer which is able to efficiently optimize a centralized model under communication constraints. The optimizer achieves this by pushing a normalized sequence of first-order gradients to a parameter server. This implies that the magnitude of a worker delta is smaller compared to an accumulated gradient, and provides a better direction towards a minimum compared to first-order gradients, which in turn also forces possible implicit momentum fluctuations to be more aligned since we make the assumption that all workers contribute towards a single minima. As a result, our approach mitigates the parameter staleness problem more effectively since staleness in asynchrony induces (implicit) momentum, and achieves a better convergence rate compared to other optimizers such as asynchronous EASGD and DynSGD, which we show empirically.

研究动机与目标

  • 解决由于参数滞后和隐式动量导致的异步数据并行优化中的不稳定性问题。
  • 在不牺牲收敛性或稳定性的情况下,减少工作者与参数服务器之间的通信频率。
  • 在高度并发的分布式训练环境中,提升收敛速度和最终模型准确率。
  • 提出一种新指标——时间效率,用于评估优化器性能,超越最终准确率,整合稳定性与达到准确率所需时间。
  • 证明在异步设置中,归一化的累积梯度相比单个一阶梯度能提供更优的更新方向。

提出的方法

  • AGN在每个工作者上本地计算一系列一阶梯度,积累阶段不进行通信。
  • 通过L2范数对累积梯度进行归一化,以减小其幅值并提升方向性。
  • 将归一化后的累积梯度发送至参数服务器以执行模型更新,从而降低滞后或发散更新的影响。
  • 该方法假设所有工作者共同朝向一个共同最小值努力,从而在各工作者间对齐隐式动量效应。
  • 参数服务器使用简单的FIFO队列聚合更新,保持与标准异步数据并行的一致性。
  • 引入时间效率作为指标,通过整合训练指标随时间的变化面积来比较不同优化器的性能。

实验结果

研究问题

  • RQ1对累积梯度进行归一化如何影响异步分布式训练中的收敛性和稳定性?
  • RQ2累积梯度归一化是否能减轻高并发环境下参数滞后和隐式动量的负面影响?
  • RQ3AGN在最终准确率、收敛速度和时间效率方面与EASGD和DYN-SGD相比表现如何?
  • RQ4使用归一化的累积梯度是否能提升工作者之间更新方向的一致性?
  • RQ5AGN在不同通信频率和工作者数量下是否仍能保持性能?

主要发现

  • 在不同超参数设置(工作者数量和通信频率)下,AGN在69.73%的实验情形中优于EASGD。
  • AGN在训练和验证准确率方面优于EASGD,尤其在高并发和通信频率较低的情况下表现更优。
  • 在40个工作者和λ=40的MNIST实验中,AGN在257.62秒内达到97.88%的测试准确率,速度和准确率均优于EASGD。
  • 时间效率指标显示,AGN在长时间训练中保持更优性能,表明其具有更好的稳定性和收敛动态。
  • AGN通过在高滞后条件下对齐工作者间的梯度方向,有效减轻了隐式动量的负面影响。
  • 该方法在多种分布式超参数配置下均保持稳健,表明其在实际部署中具有显著优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。