Skip to main content
QUICK REVIEW

[论文解读] Variance Reduction is an Antidote to Byzantines: Better Rates, Weaker Assumptions and Communication Compression as a Cherry on the Top

Eduard Gorbunov, Samuel Horváth|arXiv (Cornell University)|Jun 1, 2022
Stochastic Gradient Optimization Techniques被引用 5
一句话总结

该论文提出 Byz-VR-MARINA,一种新颖的拜占庭鲁棒分布式优化方法,通过整合方差缩减与通信压缩,在较弱假设下实现了更紧致的收敛速率。结果表明,方差缩减对于有效检测和缓解拜占庭攻击至关重要,而压缩技术则在不牺牲收敛速度的前提下实现了显著的通信节省,在非凸和 Polyak-Łojasiewicz 设置下均优于先前的最先进方法。

ABSTRACT

Byzantine-robustness has been gaining a lot of attention due to the growth of the interest in collaborative and federated learning. However, many fruitful directions, such as the usage of variance reduction for achieving robustness and communication compression for reducing communication costs, remain weakly explored in the field. This work addresses this gap and proposes Byz-VR-MARINA - a new Byzantine-tolerant method with variance reduction and compression. A key message of our paper is that variance reduction is key to fighting Byzantine workers more effectively. At the same time, communication compression is a bonus that makes the process more communication efficient. We derive theoretical convergence guarantees for Byz-VR-MARINA outperforming previous state-of-the-art for general non-convex and Polyak-Lojasiewicz loss functions. Unlike the concurrent Byzantine-robust methods with variance reduction and/or compression, our complexity results are tight and do not rely on restrictive assumptions such as boundedness of the gradients or limited compression. Moreover, we provide the first analysis of a Byzantine-tolerant method supporting non-uniform sampling of stochastic gradients. Numerical experiments corroborate our theoretical findings.

研究动机与目标

  • 通过在单一框架中整合方差缩减与通信压缩,填补拜占庭鲁棒优化中的空白。
  • 在弱于以往方法的假设下,为非凸与 Polyak-Łojasiewicz 目标函数提供更紧致的理论收敛保证。
  • 支持随机梯度的非均匀采样,以实现更灵活且更贴近现实的训练场景。
  • 证明方差缩减是实现对拜占庭工作者鲁棒性的关键机制,而不仅仅是性能提升工具。
  • 表明通信压缩可与方差缩减的拜占庭鲁棒方法有效结合,而不会降低收敛速率,从而在大规模联邦学习中实现高效通信。

提出的方法

  • 提出 Byz-VR-MARINA,一种新颖的分布式优化器,结合方差缩减(通过类似 MARINA 的更新机制)与基于几何中位数的鲁棒聚合,以抵御拜占庭工作者的影响。
  • 引入一种新分析框架,支持随机梯度的非均匀采样,提升分布式训练中的灵活性与真实性。
  • 通过一般压缩算子 Q 实现通信压缩,其误差由参数 ω 和 ζ 控制,实现比特节省且不损失收敛保证。
  • 在更弱假设下推导收敛速率:无需有界梯度或压缩约束,也无需梯度范数有界。
  • 采用一种新颖的分析技术,将方差缩减与拜占庭噪声的影响分离开来,从而对整体收敛速率实现更紧致的上界。
  • 应用一种经修改的 SAGA 类方差缩减机制,适配拜占庭环境,确保在对抗性影响下仍能实现稳定收敛。

实验结果

研究问题

  • RQ1能否将方差缩减作为核心机制,用于提升分布式优化中的拜占庭鲁棒性?
  • RQ2能否在不降低收敛速率的前提下,将通信压缩与方差缩减的拜占庭鲁棒方法结合?
  • RQ3现有最先进方法是否因有界梯度或压缩受限等限制性假设而存在松散的收敛保证?
  • RQ4在存在拜占庭工作者的情况下,能否为非凸与 Polyak-Łojasiewicz 目标函数实现紧致的收敛速率?
  • RQ5随机梯度的非均匀采样如何影响拜占庭鲁棒优化算法的收敛性与鲁棒性?

主要发现

  • Byz-VR-MARINA 的通信复杂度为 O((L + √A)Δ₀/ε²),其中 A 依赖于问题参数与压缩,且在一般非凸与 Polyak-Łojasiewicz 条件下该界是紧致的。
  • 由于更紧致的分析与更优的方差控制,该方法即使在无拜占庭工作者的情况下,收敛速率也优于先前最先进方法。
  • 对于 RandK 稀疏化且压缩比 1+ω = d/K 的情形,通信成本降低 O(d/ζ_Q) 倍,而通信轮数仅增加 O(√(1+ω)),展现出极高的通信效率。
  • 当 1+ω ≤ m 时,该方法仅需比非压缩版本多 √(1+ω) 倍的轮数,即可保持近似最优的收敛速度,实现强压缩(如仅发送 0.1% 的数据)而性能损失极小。
  • 当 m > 1/(c²δ²) 时,该方法在批量大小超过 √m 后仍能受益于更大的 b 带来的额外方差缩减效应,使拜占庭扰动更难产生影响。
  • 该分析首次支持在拜占庭鲁棒设置下实现随机梯度的非均匀采样,显著拓宽了该方法在异构数据环境下的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。