[论文解读] Device Heterogeneity in Federated Learning: A Superquantile Approach
本文提出Δ-FL,一种联邦学习框架,通过优化基于超分位数的损失目标(以符合度水平为参数)来解决设备异构性问题,为非符合用户生成个性化模型。该方法采用安全聚合,并结合一种通信成本与FedAvg相当的可证明收敛算法,在不牺牲平均性能的前提下显著提升了尾部分布误差的性能。
We propose a federated learning framework to handle heterogeneous client devices which do not conform to the population data distribution. The approach hinges upon a parameterized superquantile-based objective, where the parameter ranges over levels of conformity. We present an optimization algorithm and establish its convergence to a stationary point. We show how to practically implement it using secure aggregation by interleaving iterations of the usual federated averaging method with device filtering. We conclude with numerical experiments on neural networks as well as linear models on tasks from computer vision and natural language processing.
研究动机与目标
- 解决联邦学习中客户端数据分布偏离总体分布的统计异构性问题。
- 在不降低符合用户性能的前提下,提升非符合用户(如潮流引领者、区域用户)的模型性能。
- 开发一种可扩展、隐私保护的优化方法,通信效率与FedAvg相当。
- 通过为每个设备调节符合度旋钮,在测试时实现个性化推理。
- 在非光滑、非凸目标下,建立所提算法收敛至驻点的理论保证。
提出的方法
- 框架在损失分布上使用参数化的超分位数目标,其中参数表示设备对总体的符合度水平。
- 提出一种新型优化算法,通过平滑技术交替更新模型参数并估计超分位数。
- 利用下确界卷积平滑技术处理超分位数的非光滑性,从而支持基于梯度的更新。
- 通过将FedAvg风格的轮次与基于符合度估计的设备过滤相结合,实现安全聚合。
- 通过重用标准安全聚合原 primitive,保持每轮通信成本与FedAvg恒定。
- 在训练过程中应用设备过滤,排除低符合度设备参与超分位数估计,从而提升鲁棒性。
实验结果
研究问题
- RQ1基于超分位数的目标能否有效提升联邦学习中非符合用户的模型性能?
- RQ2在通信与隐私约束下,如何高效优化非光滑的超分位数目标?
- RQ3在重尾损失分布下,设备过滤对收敛性和性能有何影响?
- RQ4所提方法能否在保持与FedAvg相当的通信效率的同时实现个性化?
- RQ5超分位数参数更新频率的选择如何影响收敛性与泛化性能?
主要发现
- Δ-FL显著降低了非符合设备上的误分类误差方差,尤其在神经网络上对误差的上四分位数改善更为明显。
- 在EMNIST和Sent140数据集上,Δ-FL在平均误差性能上与FedAvg相当,但在测试误差的90百分位数上显著优于FedAvg。
- 设备过滤使每轮选择设备数量保持稳定,5次随机运行中波动极小,表明具有鲁棒性。
- 对于EMNIST线性模型,增加超分位数参数(Tη)的更新周期可提升性能,表明其对优化频率敏感。
- 该算法以高概率收敛至驻点,理论保证由下确界卷积平滑与次微分分析支持。
- 该框架通过符合度旋钮支持测试时的个性化推理,使用户可根据自身数据分布选择定制化模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。