[论文解读] Federated Multi-Armed Bandits Under Byzantine Attacks
本文提出 Fed-MoM-UCB,一种鲁棒的联邦多臂赌博机算法,利用众数平均估计器抵抗最多一半客户端池的拜占庭攻击。即使在存在通信开销和恶意更新的情况下,该算法仍能实现相对于不可避免误差范围的 O(log T) 累积遗憾,确保在存在恶意客户端的去中心化、非独立同分布环境中的可靠学习。
Multi-armed bandits (MAB) is a sequential decision-making model in which the learner controls the trade-off between exploration and exploitation to maximize its cumulative reward. Federated multi-armed bandits (FMAB) is an emerging framework where a cohort of learners with heterogeneous local models play an MAB game and communicate their aggregated feedback to a server to learn a globally optimal arm. Two key hurdles in FMAB are communication-efficient learning and resilience to adversarial attacks. To address these issues, we study the FMAB problem in the presence of Byzantine clients who can send false model updates threatening the learning process. We analyze the sample complexity and the regret of $β$-optimal arm identification. We borrow tools from robust statistics and propose a median-of-means (MoM)-based online algorithm, Fed-MoM-UCB, to cope with Byzantine clients. In particular, we show that if the Byzantine clients constitute less than half of the cohort, the cumulative regret with respect to $β$-optimal arms is bounded over time with high probability, showcasing both communication efficiency and Byzantine resilience. We analyze the interplay between the algorithm parameters, a discernibility margin, regret, communication cost, and the arms' suboptimality gaps. We demonstrate Fed-MoM-UCB's effectiveness against the baselines in the presence of Byzantine attacks via experiments.
研究动机与目标
- 形式化在拜占庭客户端攻击下的联邦多臂赌博机(FMAB)框架,其中客户端发送被污染的模型更新。
- 开发一种鲁棒的学习算法,即使多达一半的客户端为敌对客户端,也能保持性能。
- 分析通信开销、遗憾、算法参数与由客户端采样引起的不可避免误差范围之间的权衡。
- 在不同攻击条件下,展示所提方法相较于基线方法(如 Fed2-UCB)的优越性。
提出的方法
- 本文提出 Fed-MoM-UCB,一种基于 UCB 的算法,利用众数平均(MoM)估计器聚合客户端更新,增强对拜占庭客户端的鲁棒性。
- 将客户端更新划分为不相交的子组,计算各组均值的中位数以估计全局臂质量,从而最小化恶意异常值的影响。
- 利用高概率浓度不等式维护对臂奖励的置信区间,该不等式考虑了 MoM 估计器的方差和不可避免的误差范围。
- 基于消除所有 β-次优臂或使置信区间满足 E_p ≤ β/4 的条件,定义终止条件,以在通信开销与遗憾之间取得平衡。
- 引入映射函数 α(λ) 以确定客户端组数和所需客户端数 M,分析几何、调和及多项式映射在性能权衡上的表现。
- 理论分析推导出依赖于次优性差距、不可避免误差范围 ω 以及与通信和遗憾成比例的常数的 O(log T) 遗憾上界。
实验结果
研究问题
- RQ1当多达一半的客户端为拜占庭客户端并发送任意恶意更新时,联邦多臂赌博机系统能否保持低遗憾?
- RQ2在存在拜占庭客户端的情况下,性能的根本限制是什么?其与由客户端采样引起的不可避免误差范围有何关联?
- RQ3算法参数(如客户端组数和映射函数 α(λ))如何影响通信开销、遗憾与鲁棒性之间的权衡?
- RQ4在不同拜占庭客户端比例和攻击方案下,Fed-MoM-UCB 相较于现有基线方法(如 Fed2-UCB)的性能优势有多大?
主要发现
- 即使多达一半的客户端为拜占庭客户端,Fed-MoM-UCB 仍能实现相对于不可避免误差范围 ω 的 O(log T) 累积遗憾上界。
- 不可避免的误差范围 ω 源于 MoM 估计器中客户端组规模非递增的特性,无法通过增加客户端数量消除。
- 当 λ = 0.25(25% 拜占庭客户端)时,Fed2-UCB 无法识别全局最优臂并导致线性遗憾,而 Fed-MoM-UCB 成功消除了所有 β-次优臂。
- 几何映射 α(λ) 表现最佳,所需 M = 123 名客户端;而多项式映射需 M = 362 名客户端,表明映射选择对通信效率有显著影响。
- 即使不考虑通信开销,当 λ = 0.2 时,Fed-MoM-UCB 的遗憾仍高于 Fed2-UCB,这是由于终止时间更长,但其在更高攻击比例下展现出更强的鲁棒性。
- 当活跃臂集合缩减为 {10} 或 E_p ≤ β/4 时,算法终止并停止通信,从而确保通信开销可控。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。