[论文解读] FedBalancer: Data and Pace Control for Efficient Federated Learning on Heterogeneous Clients
FedBalancer 是一种系统化的联邦学习框架,通过客户端样本选择与自适应截止时间控制,联合优化数据与训练节奏,从而提升准确率达成时间。它利用差分隐私的损失阈值选择高价值样本,并动态设定训练轮次截止时间,相比基线联邦学习方法,收敛速度提升 1.20–4.48×,准确率提高 1.1–5.0%。
Federated Learning (FL) trains a machine learning model on distributed clients without exposing individual data. Unlike centralized training that is usually based on carefully-organized data, FL deals with on-device data that are often unfiltered and imbalanced. As a result, conventional FL training protocol that treats all data equally leads to a waste of local computational resources and slows down the global learning process. To this end, we propose FedBalancer, a systematic FL framework that actively selects clients' training samples. Our sample selection strategy prioritizes more "informative" data while respecting privacy and computational capabilities of clients. To better utilize the sample selection to speed up global training, we further introduce an adaptive deadline control scheme that predicts the optimal deadline for each round with varying client training data. Compared with existing FL algorithms with deadline configuration methods, our evaluation on five datasets from three different domains shows that FedBalancer improves the time-to-accuracy performance by 1.20~4.48x while improving the model accuracy by 1.1~5.0%. We also show that FedBalancer is readily applicable to other FL approaches by demonstrating that FedBalancer improves the convergence speed and accuracy when operating jointly with three different FL algorithms.
研究动机与目标
- 解决传统联邦学习对所有客户端数据一视同仁所导致的计算资源浪费及在异构、非均衡数据上收敛缓慢的问题。
- 克服在不损害客户端数据隐私或无需数据共享的前提下选择信息量丰富样本的挑战。
- 通过根据客户端数据特征与计算能力动态调整训练轮次截止时间,提升准确率达成时间的性能。
- 设计一种与现有联邦学习算法兼容的框架,可逐步集成以提升收敛速度与模型准确率。
- 通过聚焦于在紧凑截止时间内训练高价值样本,使低性能设备能够有效参与训练。
提出的方法
- 提出一种客户端-服务器协同机制,客户端本地使用差分隐私的损失阈值估算样本价值,实现无需完整模型微调的隐私保护型信息样本选择。
- 引入基于损失幅度的统计价值度量,识别对模型提升贡献最大的高影响力训练样本,优先选择。
- 设计一种基于新指标——截止时间效率(DDL-E)的自适应截止时间控制策略,以预测能最大化单位时间内完成客户端数量的最优轮次截止时间。
- 采用两阶段流程:第一阶段,客户端每轮选择一组高价值样本;第二阶段,服务器根据客户端反馈与数据分布计算并广播最优截止时间。
- 通过将样本选择与截止时间控制与核心聚合过程解耦,无缝集成至现有联邦学习算法。
- 在样本价值估算过程中使用差分隐私保护客户端级统计信息,确保符合联邦学习的隐私优先设计原则。
实验结果
研究问题
- RQ1如何在不损害数据隐私的前提下,提升异构客户端上联邦学习的收敛速度?
- RQ2何种样本选择策略可高效利用客户端有限的计算资源,同时保持或提升模型准确率?
- RQ3如何动态调整截止时间以适应不同的客户端数据分布与训练负载,从而最大化轮次完成效率?
- RQ4结合样本选择与截止时间控制的系统化框架,在准确率达成时间与模型准确率方面,相较于现有联邦学习基线,性能提升程度如何?
- RQ5所提出的框架是否可与其它联邦学习算法有效结合,进一步提升性能?
主要发现
- 与采用固定或启发式截止时间配置的现有联邦学习算法相比,FedBalancer 在准确率达成时间性能上提升 1.20× 至 4.48×。
- 在涵盖移动性、交通与医学影像等不同领域的五个真实世界数据集上,该框架在最终模型准确率上实现 1.1% 至 5.0% 的提升。
- 样本选择将无信息量样本的比例从 93.2% 降低至 20%,显著提升了低性能设备上的训练效率。
- 基于 DDL-E 指标引导的自适应截止时间控制机制,通过与客户端实际训练进度对齐,更高效地利用客户端资源,加快全局收敛速度。
- FedBalancer 与三种现有联邦学习算法(FedAvg、FedProx、FedNova)兼容,并在集成后均表现出一致的性能提升。
- 使用差分隐私的损失阈值确保在样本选择过程中不暴露原始数据或标签,保护客户端隐私的同时实现有效的价值估算。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。