[论文解读] Byzantine-Robust Learning on Heterogeneous Datasets via Bucketing
本文提出了一种分桶机制,使现有的拜占庭容错聚合算法能够在数据异构性(非独立同分布)条件下实现可证明的收敛性,而此前的方法在该设置下会失效。通过在聚合前将梯度重新组织为随机分桶,该方法在抵御恶意工作者和数据异构性方面均表现出鲁棒性,实现了最优收敛速率,并在温和条件下实现对精确最优解的收敛。
In Byzantine robust distributed or federated learning, a central server wants to train a machine learning model over data distributed across multiple workers. However, a fraction of these workers may deviate from the prescribed algorithm and send arbitrary messages. While this problem has received significant attention recently, most current defenses assume that the workers have identical data. For realistic cases when the data across workers are heterogeneous (non-iid), we design new attacks which circumvent current defenses, leading to significant loss of performance. We then propose a simple bucketing scheme that adapts existing robust algorithms to heterogeneous datasets at a negligible computational cost. We also theoretically and experimentally validate our approach, showing that combining bucketing with existing robust algorithms is effective against challenging attacks. Our work is the first to establish guaranteed convergence for the non-iid Byzantine robust problem under realistic assumptions.
研究动机与目标
- 解决拜占庭容错联邦学习中的关键空白:现有方法在真实数据异构性(非独立同分布)条件下失效的问题。
- 证明当前的鲁棒聚合规则即使在无攻击情况下,于非独立同分布数据中也会灾难性地失效,揭示现有防御机制的根本脆弱性。
- 设计一种简单、即插即用的分桶机制,当与现有鲁棒聚合器结合时,可在非独立同分布数据下恢复可证明的收敛性。
- 在温和假设下,首次为拜占庭容错优化在非独立同分布数据下的收敛至精确最优解建立理论保证。
- 在真实异构数据集上,针对已知和新型攻击对方法进行实证验证。
提出的方法
- 引入一个分桶步骤,在聚合前将各工作者的梯度随机划分为多个桶,确保每个桶都包含整体数据分布的代表性样本。
- 提出一种鲁棒聚合器的正式定义(ARAgg),当与分桶结合时,即使在对抗性行为和数据异构性下也能保证收敛。
- 将标准鲁棒聚合规则——Krum、坐标中位数、几何中位数(RFA)——与分桶结合,实现在非独立同分布设置下的可证明鲁棒性。
- 结合分桶与工作者动量,实现与已知拜占庭容错优化下界匹配的最优收敛速率。
- 采用基于理论分析推导出的步长规则,以平衡收敛速度与鲁棒性,最小化迭代过程中期望梯度范数。
- 理论分析表明,该方法收敛至大小为 $ O( ho heta^2) $ 的邻域,其中 $ ho $ 为拜占庭工作者的比例,$ heta^2 $ 衡量数据异构性;当异构性较弱或模型过参数化时,可收敛至精确最优解。
实验结果
研究问题
- RQ1为何现有拜占庭容错聚合规则在非独立同分布数据设置下会失效,即使没有恶意攻击?
- RQ2一个简单轻量的预处理步骤——分桶——是否能恢复异构联邦学习中的鲁棒性与收敛性?
- RQ3是否可能在拜占庭容错非独立同分布联邦学习中实现收敛至精确全局最优解?在何种条件下可实现?
- RQ4分桶与工作者动量的结合如何提升收敛速率,相较于现有方法有何优势?
- RQ5所提方法能否抵御最先进的数据异构性感知攻击,如模仿攻击?
主要发现
- 所提出的分桶机制使现有鲁棒聚合规则(如 Krum、坐标中位数、几何中位数)在非独立同分布数据下实现可证明收敛,而这些规则原本在该设置下会失效。
- 该方法实现了与已知拜占庭容错优化下界匹配的最优收敛速率,期望梯度范数随 $ O(1/T) $ 减小。
- 在数据异构性较弱或模型过参数化时,该方法可收敛至精确全局最优解,这是此前非独立同分布拜占庭容错学习中未建立的结果。
- 实证评估显示,该方法在真实异构数据集上对已知和新型攻击均表现出显著性能提升,显著优于先前方法。
- 理论分析揭示,收敛边界为 $ O( ho heta^2) $,其中 $ ho $ 为拜占庭工作者比例,$ heta^2 $ 衡量数据异构性;在有利条件下,该边界可缩小至零。
- 该方法无需有界梯度假设或强凸性,适用于真实联邦学习环境中的一般非凸目标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。