Skip to main content
QUICK REVIEW

[论文解读] Distributed Momentum for Byzantine-resilient Learning

El Mahdi El Mhamdi, Rachid Guerraoui|arXiv (Cornell University)|Feb 28, 2020
Privacy-Preserving Technologies in Data参考文献 35被引用 15
一句话总结

本文提出在分布式SGD中于工作节点端计算动量,通过降低梯度估计的方差-范数比,提升拜占庭鲁棒性,从而增强鲁棒聚合规则的性能。实验表明,与服务器端动量相比,该方法可将拜占庭攻击导致的交叉准确率下降降低最多11倍。

ABSTRACT

Momentum is a variant of gradient descent that has been proposed for its benefits on convergence. In a distributed setting, momentum can be implemented either at the server or the worker side. When the aggregation rule used by the server is linear, commutativity with addition makes both deployments equivalent. Robustness and privacy are however among motivations to abandon linear aggregation rules. In this work, we demonstrate the benefits on robustness of using momentum at the worker side. We first prove that computing momentum at the workers reduces the variance-norm ratio of the gradient estimation at the server, strengthening Byzantine resilient aggregation rules. We then provide an extensive experimental demonstration of the robustness effect of worker-side momentum on distributed SGD.

研究动机与目标

  • 解决在部分工作节点为拜占庭节点(恶意或故障)时,保持分布式机器学习鲁棒性的挑战。
  • 克服现有拜占庭鲁棒聚合规则的局限性,即依赖于诚实梯度的有界方差-范数比。
  • 通过在工作节点端计算动量,降低方差-范数比,从而提升服务器端梯度质量。
  • 证明工作节点端动量可增强标准鲁棒聚合规则(如Krum和Median)的有效性。

提出的方法

  • 通过使用衰减因子μ对历史梯度的运行和进行指数加权,实现在工作节点端应用动量。
  • 工作节点端的动量更新定义为:m_t = μ * m_{t-1} + (1 - μ) * g_t,其中g_t为当前梯度。
  • 将此动量计算后的梯度作为输入传递给服务器端的鲁棒聚合规则,而非原始梯度。
  • 理论分析表明,工作节点端动量可降低诚实梯度的方差-范数比,这是基于中位数的聚合规则的关键因素。
  • 该方法兼容同步和异步SGD设置,并在异步设置中可与过滤方案共存。
  • 与服务器端动量相比,该方法不引入额外计算开销,因为计算被移至工作节点,且无需额外通信。

实验结果

研究问题

  • RQ1在拜占庭鲁棒的分布式学习中,于工作节点端计算动量是否能降低梯度估计的方差-范数比?
  • RQ2工作节点端动量是否能提升标准拜占庭鲁棒聚合规则(如Krum和Median)的鲁棒性?
  • RQ3在拜占庭攻击下,工作节点端动量与服务器端动量在收敛性和准确率方面相比如何?
  • RQ4工作节点端动量在何种条件下无法降低方差-范数比,以及如何缓解这一问题?
  • RQ5所提方法能否扩展至存在拜占庭服务器的异步或完全去中心化设置?

主要发现

  • 工作节点端动量降低了诚实梯度估计的方差-范数比,从而增强了拜占庭鲁棒聚合规则的鲁棒性。
  • 实验表明,与服务器端动量相比,使用工作节点端动量可使top-1交叉准确率提升5%至50%。
  • 该方法在拜占庭攻击下可将交叉准确率下降最多减少11倍,尤其在CIFAR-10数据集上使用Median聚合规则时表现显著。
  • 随着训练进行,方差-范数比逐渐降低,特别是在学习率减小后,与理论预测一致。
  • 工作节点端动量在非线性聚合规则下依然有效,而服务器端动量则依赖于线性性。
  • 该方法在不同数据集(MNIST、CIFAR-10)和攻击类型(如Baruch et al., 2019;Xie et al., 2019)下均表现良好,展现出广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。