[论文解读] Byzantine-Robust Decentralized Learning via ClippedGossip
该论文提出 ClippedGossip,一种拜占庭鲁棒的去中心化学习算法,可在任意通信图上实现对非凸目标函数的可证明收敛,收敛至一个 $Δ_{αααα}ξ^{2}/γ^{2}$ 邻域内的驻点。该方法结合了局部裁剪与 gossip 平均,可在抵御恶意工作者的同时,即使在对抗性条件下仍保持快速收敛速率。
In this paper, we study the challenging task of Byzantine-robust decentralized training on arbitrary communication graphs. Unlike federated learning where workers communicate through a server, workers in the decentralized environment can only talk to their neighbors, making it harder to reach consensus and benefit from collaborative training. To address these issues, we propose a ClippedGossip algorithm for Byzantine-robust consensus and optimization, which is the first to provably converge to a $O(δ_{\max}ζ^2/γ^2)$ neighborhood of the stationary point for non-convex objectives under standard assumptions. Finally, we demonstrate the encouraging empirical performance of ClippedGossip under a large number of attacks.
研究动机与目标
- 解决在任意通信图中去中心化训练的拜占庭鲁棒性挑战,其中工作者仅与邻居通信且不存在中心服务器。
- 克服先前方法的局限性,这些方法需要密集连接、缺乏收敛保证,或假设网络中存在诚实多数。
- 基于谱隙 $γ$ 和拜占庭工作者数量 $Δ_{αααα}$ 建立新的网络鲁棒性准则,适用于更广泛的图拓扑。
- 在标准假设下,为鲁棒的去中心化随机非凸优化提供首个可证明收敛速率。
- 通过引入局部动量,提升非鲁棒去中心化 SGD 的收敛速率。
提出的方法
- ClippedGossip 每轮迭代分三个阶段进行:(1) 工作者收集邻居模型,(2) 将邻居模型裁剪至以自身模型为中心、半径为 $\tau_i^{t+1}$ 的范围内,以限制异常值的影响,(3) 对裁剪后的模型执行 gossip 平均。
- 裁剪步骤确保拜占庭更新(可能任意大)被限制在有界范围内,无法主导共识过程。
- 该方法使用混合矩阵定义 gossip 平均过程,确保信息在网络中传播的同时保持鲁棒性。
- 提出一种新颖的网络鲁棒性准则,将收敛性与通信图的谱隙 $γ$ 及最大拜占庭工作者数 $Δ_{αααα}$ 联系起来。
- 该算法无需全局诚实多数或安全广播,适用于现实世界中的去中心化系统。
- 通过引入局部动量,实现非鲁棒设置下的更快收敛速率,优于先前的最先进方法。
实验结果
研究问题
- RQ1我们能否设计一种去中心化学习算法,在任意通信图上对拜占庭攻击实现可证明收敛?
- RQ2通信图的谱隙 $γ$ 和拜占庭工作者数量 $Δ_{αααα}$ 如何共同影响去中心化学习的鲁棒性与收敛性?
- RQ3通过引入局部动量,能否实现非鲁棒去中心化 SGD 的更快收敛速率?
- RQ4在现实攻击模型下,ClippedGossip 与先前方法相比在收敛速度和鲁棒性方面表现如何?
- RQ5当拜占庭工作者被战略性地放置以破坏信息流时,该算法是否仍能维持共识?
主要发现
- 在标准假设下,ClippedGossip 对非凸目标函数实现了可证明收敛,收敛至 $Δ_{αααα}ξ^{2}/γ^{2}$ 邻域内的驻点。
- 该方法提出了一种基于谱隙 $γ$ 和 $Δ_{αααα}$ 的新鲁棒性准则,其适用范围广于先前工作所要求的密集连接或诚实多数。
- ClippedGossip 在收敛速度和鲁棒性方面均优于现有方法,尤其在放大诚实工作者间分歧的不一致攻击下表现更优。
- 即使在强拜占庭攻击下,该算法仍能保持快速收敛,包括那些利用拓扑结构和梯度方差的攻击。
- 该论文建立了非鲁棒去中心化随机非凸优化的最快已知收敛速率:使用局部动量时为 $Δ(\frac{\sigma^{2}}{n\varepsilon^{2}} + \frac{\sigma^{2/3}}{\gamma^{2/3}\varepsilon^{4/3}})$。
- 实验结果表明,ClippedGossip 即使在存在拜占庭工作者时也能可靠收敛,而先前方法如 TM 在 Dumbbell 等常见拓扑结构或非独立同分布数据下无法达成共识。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。