Skip to main content
QUICK REVIEW

[论文解读] Specialized federated learning using a mixture of experts

Edvin Listo Zec, Olof Mogren|arXiv (Cornell University)|Oct 5, 2020
Privacy-Preserving Technologies in Data参考文献 30被引用 15
一句话总结

本文提出了一种联邦专家混合模型(FedMoE)框架,通过结合全局模型与客户端特定的本地专家模型,在异构、非独立同分布(non-IID)数据设置下实现个性化、隐私保护的学习。通过使用门控函数根据输入动态加权专家,FedMoE 在本地性能上可媲美微调模型,同时在泛化能力上显著优于后者,即使在高客户端退出率的情况下也表现优异。

ABSTRACT

In federated learning, clients share a global model that has been trained on decentralized local client data. Although federated learning shows significant promise as a key approach when data cannot be shared or centralized, current methods show limited privacy properties and have shortcomings when applied to common real-world scenarios, especially when client data is heterogeneous. In this paper, we propose an alternative method to learn a personalized model for each client in a federated setting, with greater generalization abilities than previous methods. To achieve this personalization we propose a federated learning framework using a mixture of experts to combine the specialist nature of a locally trained model with the generalist knowledge of a global model. We evaluate our method on a variety of datasets with different levels of data heterogeneity, and our results show that the mixture of experts model is better suited as a personalized model for devices in these settings, outperforming both fine-tuned global models and local specialists.

研究动机与目标

  • 解决在异构、非独立同分布客户端数据设置下个性化模型学习的挑战。
  • 在保持高本地准确率的同时,提升对微调本地模型的泛化性能。
  • 通过允许客户端完全退出联邦聚合,实现强大的隐私保障,同时不损害模型效用。
  • 开发一种兼容任意基于梯度的模型的灵活框架,支持不同水平的客户端参与。
  • 在图像和文本分类任务中,评估该方法在多样化数据异质性和退出条件下的表现。

提出的方法

  • 该框架为每个客户端使用一个专家混合模型,结合一个全局模型和一个本地专家模型,并通过客户端特定的门控函数对专家输出进行加权。
  • 首先使用 FedAvg 在所有客户端的数据上训练全局模型,然后从全局模型初始化本地专家模型,并在本地数据上进行训练。
  • 整个混合模型(包括本地专家模型、全局模型和客户端特定的门控函数)进行联合微调。
  • 门控函数根据输入特征动态将输入路由到最合适的专家(全局或本地),从而实现自适应个性化。
  • 客户端可完全退出联邦聚合,从而保护其数据隐私,同时仍能通过全局模型进行推理。
  • 该方法兼容任意可微机器学习模型,并支持多种不同类型模型的集成。

实验结果

研究问题

  • RQ1联邦专家混合模型能否在保持高本地性能的同时,实现优于微调本地模型的泛化性能?
  • RQ2在高客户端退出率下(仅少数客户端参与全局模型更新),所提出方法的表现如何?
  • RQ3专家混合方法在不同类型的数据异质性(如先验概率偏移)下是否具有良好的泛化能力?
  • RQ4在 IID 和非 IID 数据设置下,专家混合方法与 FedAvg 的性能相比如何?
  • RQ5在现实联邦设置中,该框架能否在实现有效个性化的同时维持强大的隐私保障?

主要发现

  • 在所有数据集上,FedMoE 模型在全局测试集上的表现均优于微调本地模型,展现出更优的泛化能力,同时与本地性能保持一致。
  • 在 CIFAR-10、AG News 和 Fashion-MNIST 数据集上,专家混合模型的全局测试准确率始终更接近 FedAvg,尤其在高数据异质性条件下表现更优。
  • 在 90% 和 95% 的客户端退出率下,FedMoE 模型仍保持强大的泛化性能,在全局测试集上优于微调基线模型。
  • 在 IID 情况下(p=0.2),专家混合模型甚至在泛化性能上超越了 FedAvg,表明其对低参与率具有鲁棒性。
  • 该方法在本地测试准确率上与微调模型相当,证明个性化并未以牺牲本地性能为代价。
  • 框架对不同水平的数据异质性具有鲁棒性,如在不同 Dirichlet α 值和多数类比例下所展示的结果所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。