[论文解读] Personalized Federated Learning for Heterogeneous Clients with Clustered Knowledge Transfer
该论文提出 PerFed-CKT,一种个性化联邦学习框架,通过基于 logits 的聚类知识迁移,使异构客户端能够在不直接交换模型参数的情况下训练个性化模型。该方法通过根据数据分布对客户端进行聚类,并在每个聚类内仅传输预测 logits,实现了比现有方法低几个数量级的通信成本,同时达到最先进水平的测试准确率。
Personalized federated learning (FL) aims to train model(s) that can perform well for individual clients that are highly data and system heterogeneous. Most work in personalized FL, however, assumes using the same model architecture at all clients and increases the communication cost by sending/receiving models. This may not be feasible for realistic scenarios of FL. In practice, clients have highly heterogeneous system-capabilities and limited communication resources. In our work, we propose a personalized FL framework, PerFed-CKT, where clients can use heterogeneous model architectures and do not directly communicate their model parameters. PerFed-CKT uses clustered co-distillation, where clients use logits to transfer their knowledge to other clients that have similar data-distributions. We theoretically show the convergence and generalization properties of PerFed-CKT and empirically show that PerFed-CKT achieves high test accuracy with several orders of magnitude lower communication cost compared to the state-of-the-art personalized FL schemes.
研究动机与目标
- 解决现有个性化联邦学习方法的局限性,这些方法假设模型架构同质且因模型参数交换导致高通信成本。
- 提升在高度异构数据与系统环境中数据稀缺客户端的个性化性能。
- 通过用 logits 的知识迁移替代模型参数传输,降低联邦学习中的通信开销。
- 通过聚类利用客户端间的数据分布相似性,防止知识迁移过程中的无关知识吸收。
- 为所提出的在异构设置下的个性化联邦学习框架提供理论收敛性与泛化性保证。
提出的方法
- 客户端使用本地数据训练个性化模型,其异构架构根据其系统能力和数据规模量身定制。
- 服务器基于客户端在其模型对共享无标签数据集的预测 logits 执行客户端聚类。
- 知识迁移通过协同蒸馏实现,其中每个客户端使用其所在聚类内客户端的平均预测来正则化其本地损失,而非所有客户端的预测。
- 该方法使用聚类感知正则化项,惩罚对聚类平均预测的偏离,从而提升在相似数据分布下的泛化能力。
- 通信仅限于在公共无标签数据集上交换 logits(模型预测),与模型参数传输相比显著降低带宽使用。
- 该框架支持模型同质与异质两种设置,可在多样客户端中实现实际部署。
实验结果
研究问题
- RQ1在客户端数据与系统异构性存在的情况下,个性化联邦学习能否在显著降低通信成本的同时实现高测试准确率?
- RQ2基于数据分布对客户端进行聚类,与在协同蒸馏中使用所有客户端预测相比,如何提升泛化性能?
- RQ3在采用知识迁移的个性化联邦学习中,聚类数量对模型性能与通信效率有何影响?
- RQ4个性化联邦学习框架能否在不损害性能或增加通信量的前提下,支持客户端间异构模型架构?
- RQ5在采用聚类知识迁移的个性化联邦学习系统中,可以提供哪些关于收敛性与泛化性的理论保证?
主要发现
- 当 C=0.1 时,PerFed-CKT 仅通信 5.2×10⁷ 个参数,即达到 74.31% 的测试准确率,通信效率相比 FedFomo 最高提升 750 倍。
- 当 C=0.15 时,PerFed-CKT 达到 76.74% 的测试准确率,通信成本为 7.2×10⁷,相比 FedFomo 的 5850×10⁷ 参数通信量,最高节省 812.5 倍。
- 在模型异构性下,PerFed-CKT 仍保持高性能,通信成本分别降低至 4.8×10⁷(C=0.1 时准确率 72.25%)和 6.8×10⁷(C=0.15 时准确率 76.14%)。
- 当 C=0.1 时,最优聚类数为 c=3;当 C=0.15 时,最优聚类数为 c=2;进一步增加聚类数会因聚类多样性与信息丰富度下降而导致准确率降低。
- PerFed-CKT 表明聚类可提升泛化能力,通过防止客户端从不相似客户端吸收无关知识,该结论得到理论收敛性与泛化界的支持。
- 该框架在模型异构设置下保持强性能,表明个性化模型可在不强制要求客户端间模型架构统一的前提下被有效训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。