Skip to main content
QUICK REVIEW

[论文解读] ByGARS: Byzantine SGD with Arbitrary Number of Attackers

Jayanth Reddy Regatti, Hao Chen|arXiv (Cornell University)|Jun 24, 2020
Privacy-Preserving Technologies in Data参考文献 41被引用 8
一句话总结

本文提出 ByGARS 和 ByGARS++,两种用于分布式机器学习的鲁棒随机梯度下降算法,通过使用从辅助数据集计算出的声誉分数,能够处理任意数量的拜占庭攻击者。这些声誉分数通过与辅助梯度的内积计算得出,实现加权聚合,确保在强凸性条件下收敛,并对各类攻击具有鲁棒性,即使超过一半的工作者为攻击者亦然。

ABSTRACT

We propose two novel stochastic gradient descent algorithms, ByGARS and ByGARS++, for distributed machine learning in the presence of any number of Byzantine adversaries. In these algorithms, reputation scores of workers are computed using an auxiliary dataset at the server. This reputation score is then used for aggregating the gradients for stochastic gradient descent. The computational complexity of ByGARS++ is the same as the usual distributed stochastic gradient descent method with only an additional inner product computation in every iteration. We show that using these reputation scores for gradient aggregation is robust to any number of multiplicative noise Byzantine adversaries and use two-timescale stochastic approximation theory to prove convergence for strongly convex loss functions. We demonstrate the effectiveness of the algorithms for non-convex learning problems using MNIST and CIFAR-10 datasets against almost all state-of-the-art Byzantine attacks. We also show that the proposed algorithms are robust to multiple different types of attacks at the same time.

研究动机与目标

  • 解决先前拜占庭鲁棒方法的局限性,即假设少于一半的工作者为攻击者。
  • 开发一种对任意数量拜占庭对手(包括具有任意或恶意梯度更新的对手)均鲁棒的梯度聚合机制。
  • 在 MNIST 和 CIFAR-10 上的非凸学习设置(如深度学习)下,于多种攻击模型中实现收敛与鲁棒性能。
  • 设计一种不依赖于中位数或多数投票等假设的防御机制,而是采用基于声誉的加权平均。

提出的方法

  • 服务器维护一个从与训练数据相同分布中抽取的小型辅助数据集,用于计算参考梯度。
  • 每个工作者的声誉分数通过其梯度与辅助梯度之间的内积计算,反映其与真实优化方向的一致性。
  • 声誉分数用于加权梯度聚合,允许负分抑制攻击性贡献。
  • ByGARS++ 使用双时间尺度随机逼近方法更新声誉分数与模型参数,确保在强凸性条件下的收敛性。
  • 该方法避免依赖几何中位数或基于范数的过滤,转而使用方向对齐作为鲁棒性标准。
  • 通过双时间尺度随机逼近理论,证明了强凸目标下的理论收敛性。

实验结果

研究问题

  • RQ1当超过一半的工作者为拜占庭攻击者时,分布式 SGD 算法是否仍能保持鲁棒性并实现收敛?
  • RQ2从辅助数据中导出的声誉分数如何在存在任意恶意梯度的情况下改善梯度聚合?
  • RQ3在混合或多种类型的拜占庭攻击下(包括符号翻转、标签翻转、常数或高斯噪声注入),该方法是否仍能保持性能?
  • RQ4当攻击者比例达到 0.5 时,为何该方法在 LIE 攻击下会失效?其根本限制是什么?
  • RQ5在无攻击情况下,基于声誉的聚合是否仍能优于标准基线方法,且不引入性能折衷?

主要发现

  • 在 MNIST 和 CIFAR-10 上,即使全部七个工作者均为攻击者,ByGARS 和 ByGARS++ 仍能实现鲁棒收敛,优于基线平均和中位数聚合方法。
  • 除在 f=0.5 条件下的 LIE 攻击外,该算法对所有测试的拜占庭攻击(包括符号翻转、标签翻转、高斯噪声、常数梯度及混合攻击)均表现出鲁棒性。
  • 当攻击者比例超过 0.5 时,基于中位数的聚合方法完全失效,而 ByGARS 和 ByGARS++ 仍保持高准确率,表明其在高攻击者比例场景下的优越性。
  • 在无攻击情况下,两种算法性能与标准基线相当,表明声誉机制未造成性能下降。
  • 在 f=0.5 的 LIE 攻击下,声誉分数保持平衡,表明该防御机制并非基于范数或幅度过滤,而是基于与辅助梯度的方向对齐。
  • 在合成强凸问题上的模拟验证了 ByGARS 和 ByGARS++ 在任意数量攻击者下均能收敛至最优解,证实了理论结论。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。