Skip to main content
QUICK REVIEW

[论文解读] Byzantine-Resilient Stochastic Gradient Descent for Distributed Learning: A Lipschitz-Inspired Coordinate-wise Median Approach

Haibo Yang, Xin Zhang|arXiv (Cornell University)|Sep 10, 2019
Stochastic Gradient Optimization Techniques参考文献 11被引用 9
一句话总结

该论文提出 LICM-SGD,一种抗拜占庭攻击的随机梯度下降方法,通过使用受利普希茨启发的坐标中位数来过滤恶意梯度。该方法在无需事先知晓攻击者数量的情况下,可抵御高达 50% 的拜占庭工作者,且保持最优的 O(md) 计算复杂度,在 MNIST 和 CIFAR-10 数据集上实现了更高的准确率和效率。

ABSTRACT

In this work, we consider the resilience of distributed algorithms based on stochastic gradient descent (SGD) in distributed learning with potentially Byzantine attackers, who could send arbitrary information to the parameter server to disrupt the training process. Toward this end, we propose a new Lipschitz-inspired coordinate-wise median approach (LICM-SGD) to mitigate Byzantine attacks. We show that our LICM-SGD algorithm can resist up to half of the workers being Byzantine attackers, while still converging almost surely to a stationary region in non-convex settings. Also, our LICM-SGD method does not require any information about the number of attackers and the Lipschitz constant, which makes it attractive for practical implementations. Moreover, our LICM-SGD method enjoys the optimal $O(md)$ computational time-complexity in the sense that the time-complexity is the same as that of the standard SGD under no attacks. We conduct extensive experiments to show that our LICM-SGD algorithm consistently outperforms existing methods in training multi-class logistic regression and convolutional neural networks with MNIST and CIFAR-10 datasets. In our experiments, LICM-SGD also achieves a much faster running time thanks to its low computational time-complexity.

研究动机与目标

  • 为解决分布式 SGD 在拜占庭攻击下的脆弱性问题,即恶意工作者发送任意梯度以破坏学习过程。
  • 开发一种无需事先知晓拜占庭工作者数量或利普希茨常数的鲁棒聚合方法。
  • 在保持与标准 SGD 相当的低计算复杂度的同时,具备对对抗性梯度的强大鲁棒性。
  • 设计一种方法,确保在非凸设置下,即使拜占庭影响较高,也能收敛至稳定区域。
  • 通过实证验证该方法在多个深度学习任务中分类准确率和运行效率方面的优越性。

提出的方法

  • 该方法引入一种受利普希茨启发的坐标中位数过滤机制,利用良性工作者梯度的平滑特性。
  • 对每个梯度坐标的值,算法在所有工作者更新中计算中位数,有效抑制由拜占庭攻击引起的异常值。
  • 该方法利用良性梯度位于利普希茨有界区域内的事实,而恶意梯度通常在大小或方向上显著偏离。
  • 坐标中位数按每个参数维度独立计算,从而对任意方向的攻击具备鲁棒性。
  • 该方法设计为计算高效,每轮迭代仅需 O(md) 时间,与标准 SGD 的复杂度相当。
  • 无需与攻击者数量或利普希茨常数相关的超参数,提升了实际部署的可行性。

实验结果

研究问题

  • RQ1基于坐标中位数的聚合方法是否能在不依赖攻击者数量知识的前提下实现拜占庭鲁棒性?
  • RQ2当高达一半的工作者为拜占庭时,该方法是否仍能在非凸设置下收敛至稳定区域?
  • RQ3所提出的受利普希茨启发的过滤机制在实践中是否能有效区分良性与恶意梯度?
  • RQ4该方法是否能在保持鲁棒性的同时,实现与标准 SGD 相当的计算复杂度?
  • RQ5在分类准确率和训练稳定性方面,该方法与最先进抗拜占庭算法相比表现如何?

主要发现

  • 在 40 名工作者中,有 18 名为拜占庭工作者的全知攻击下,LICM-SGD 在 MNIST 上使用 CNN 仍达到 85% 的测试准确率,仅比无攻击基线低 2.5%。
  • 即使拜占庭工作者数量从 0 增加到 18,该方法仍保持接近基线的性能,准确率仅从 87.5% 下降至 83.2%。
  • 在 MNIST 和 CIFAR-10 的多次实验中,LICM-SGD 在准确率和稳定性方面均优于 Krum、Bulyan、Median 和 Trimmed Mean。
  • 该方法实现了最优的 O(md) 计算复杂度,显著低于现有高鲁棒性方法的 O(m²d) 复杂度。
  • LICM-SGD 对数据样本和攻击者配置的变化不敏感,在不同运行中表现出一致的性能。
  • 该方法无需事先知晓拜占庭工作者数量或利普希茨常数,显著提升了在真实场景部署中的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。