[论文解读] Fed-ensemble: Improving Generalization through Model Ensembling in Federated Learning
Fed-ensemble 提出了一种新颖的联邦学习框架,通过基于随机排列的客户端分配方式训练并集成 K 个模型,实现无需通信开销的模型平均。理论上,它在神经正切核(NTK)框架下证明了所有 K 个模型均收敛到同一预测后验分布的样本,从而解释了集成方法在降低方差和提升泛化性能方面的优势。
In this paper we propose Fed-ensemble: a simple approach that bringsmodel ensembling to federated learning (FL). Instead of aggregating localmodels to update a single global model, Fed-ensemble uses random permutations to update a group of K models and then obtains predictions through model averaging. Fed-ensemble can be readily utilized within established FL methods and does not impose a computational overhead as it only requires one of the K models to be sent to a client in each communication round. Theoretically, we show that predictions on newdata from all K models belong to the same predictive posterior distribution under a neural tangent kernel regime. This result in turn sheds light onthe generalization advantages of model averaging. We also illustrate thatFed-ensemble has an elegant Bayesian interpretation. Empirical results show that our model has superior performance over several FL algorithms,on a wide range of data sets, and excels in heterogeneous settings often encountered in FL applications.
研究动机与目标
- 解决在数据异构性和不可靠客户端条件下联邦学习中存在的高方差与过拟合问题。
- 在不增加客户端计算或通信负担的前提下,提升现有联邦学习方法的泛化性能。
- 为联邦学习中的模型集成提供基于神经正切核(NTK)框架的理论基础。
- 建立联邦学习中集成预测过程的贝叶斯解释。
- 在多样且异构的联邦学习基准数据集上,实证验证所提方法的优越性。
提出的方法
- Fed-ensemble 维护 K 个独立的全局模型,每个模型通过标准联邦平均算法更新,但通过随机排列分配客户端,以确保模型多样性。
- 在每轮通信中,仅将 K 个模型中的一个发送给客户端,从而最小化通信开销。
- 最终预测通过平均所有 K 个模型的输出获得,利用集成平均来降低方差。
- 理论分析表明,在过参数化设置下,所有 K 个模型的预测在 NTK 框架下收敛到同一极限高斯过程的样本。
- 该方法被证明具有贝叶斯解释,其中集成平均对应于后验预测分布。
- 该框架与现有联邦学习改进方法(如 FedProx、FedAdam)正交,可与通信高效或鲁棒聚合技术无缝集成。
实验结果
研究问题
- RQ1在数据异构条件下,模型集成能否提升联邦学习的泛化性能?
- RQ2联邦学习中的集成是否能降低预测方差并提升鲁棒性?
- RQ3在神经正切核(NTK)框架下,联邦学习中模型平均的理论优势是否可被合理解释?
- RQ4在联邦学习背景下,集成预测过程的贝叶斯解释是什么?
- RQ5Fed-ensemble 在异构数据设置下与当前最先进联邦学习算法相比,其性能表现如何?
主要发现
- 在多个基准数据集(包括非独立同分布和异构数据分布)上,Fed-ensemble 的测试准确率显著优于 FedAvg 及其他基线联邦学习算法。
- 该方法在异构设置下显著降低了预测方差,表现出对数据偏移和客户端掉线的更强鲁棒性。
- 理论分析证实,在过参数化设置下,所有 K 个模型均收敛到同一极限高斯过程的样本,从而为模型平均的泛化优势提供了理论支持。
- 集成预测过程被证明具有自然的贝叶斯解释,其中平均结果对应于后验预测分布。
- 该框架不增加任何额外通信成本,因为每轮仅向每个客户端传输一个模型,从而保持了高效性。
- 实证结果表明,即使与 FedProx 或 FedAdam 等其他优化技术结合,Fed-ensemble 仍优于现有方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。