[论文解读] Enhancing Heterogeneous Federated Learning with Knowledge Extraction and Multi-Model Fusion
该论文提出FedKEM,一种资源感知的联邦学习框架,通过知识蒸馏和多模型融合增强异构联邦学习。通过将本地模型知识提炼为紧凑的知识网络以进行全局聚合,FedKEM将ResNet-32的通信成本降低最多50%,VGG-11降低10倍,同时在非独立同分布(non-IID)和异构模型设置下提升了性能与泛化能力。
Concerned with user data privacy, this paper presents a new federated learning (FL) method that trains machine learning models on edge devices without accessing sensitive data. Traditional FL methods, although privacy-protective, fail to manage model heterogeneity and incur high communication costs due to their reliance on aggregation methods. To address this limitation, we propose a resource-aware FL method that aggregates local knowledge from edge models and distills it into robust global knowledge through knowledge distillation. This method allows efficient multi-model knowledge fusion and the deployment of resource-aware models while preserving model heterogeneity. Our method improves communication cost and performance in heterogeneous data and models compared to existing FL algorithms. Notably, it reduces the communication cost of ResNet-32 by up to 50\% and VGG-11 by up to 10$ imes$ while delivering superior performance.
研究动机与目标
- 解决传统联邦学习在处理模型与数据异构性方面的局限性,特别是在非独立同分布(non-IID)和资源受限的边缘环境下的挑战。
- 通过在聚合过程中用紧凑的知识网络替代完整模型参数交换,降低联邦学习中的通信开销。
- 通过多模型融合与蒸馏,融合来自多样化本地模型的知识,提升全局模型的泛化能力与稳定性。
- 通过根据客户端计算资源匹配模型复杂度,实现异构模型在边缘设备上的公平且高效的部署。
- 开发一种可扩展、隐私保护的联邦学习解决方案,在多样化的边缘硬件与数据分布下保持高性能。
提出的方法
- 在每个本地模型并行训练一个轻量级知识网络,通过深度互学习提取并压缩模型知识。
- 在客户端与服务器之间仅传输蒸馏后的知识网络(而非完整模型权重),显著降低通信成本。
- 在服务器端通过集成多个紧凑知识网络进行多模型融合,形成稳健的全局知识表征。
- 将融合后的全局知识蒸馏回一个紧凑的全局模型并重新分发至客户端,实现高效微调。
- 采用资源感知的模型分配机制,客户端根据其内存与MAC计算能力部署相应模型(如ResNet-20、32、44),实现异构部署。
- 利用知识蒸馏在减少模型规模与通信开销的同时,保持训练轮次中的性能表现。
实验结果
研究问题
- RQ1知识蒸馏与多模型融合是否能在不损失模型准确率的前提下,降低异构联邦学习中的通信成本?
- RQ2与当前最先进的联邦学习基线方法相比,FedKEM在非独立同分布(non-IID)数据与异构客户端模型设置下的表现如何?
- RQ3在保持或提升泛化能力的前提下,紧凑知识网络在全局聚合中在多大程度上可替代完整模型参数?
- RQ4资源感知的模型部署在异构边缘环境中对训练稳定性与收敛速度有何影响?
- RQ5来自多个多样化模型的知识融合是否能生成在联邦学习中更具鲁棒性与泛化能力的全局模型?
主要发现
- 与FedAvg和FedProx等基线联邦学习方法相比,FedKEM将ResNet-32的通信成本降低最多50%,VGG-11降低10倍。
- 在100个客户端且使用ResNet-20作为知识网络的情况下,FedKEM的通信开销仅为0.074 GB,而FedProx为0.71 GB,实现一个数量级的降低。
- 当使用ResNet-20作为知识网络时,FedKEM在49轮通信内达到60%准确率,优于FedNova(在相同条件下需123轮)。
- 即使使用不同客户端模型(如ResNet-20、32、44),该方法仍能保持超过70%的高准确率,证明在多模型部署中具有稳定性能。
- 知识蒸馏与多模型融合显著降低了过拟合与方差,提升了在非独立同分布(non-IID)与异构设置下的全局模型泛化能力。
- 紧凑知识网络的使用实现了高效训练与推理,使FedKEM适用于资源受限边缘设备的实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。