Skip to main content
QUICK REVIEW

[论文解读] Motley: Benchmarking Heterogeneity and Personalization in Federated Learning

Shanshan Wu, Tian Li|arXiv (Cornell University)|Jun 18, 2022
Privacy-Preserving Technologies in Data被引用 13
一句话总结

Motley 构建了一个全面的个性化联邦学习基准,涵盖多样化的跨设备和跨小样本(cross-silo)数据集,提供五种个性化联邦学习算法的模块化实现,并在多个指标上进行了严格评估。关键发现表明,‘最佳’方法在很大程度上取决于评估标准;在跨设备设置中,超参数调优是主要挑战;个性化在性能、公平性和通信效率之间存在权衡。

ABSTRACT

Personalized federated learning considers learning models unique to each client in a heterogeneous network. The resulting client-specific models have been purported to improve metrics such as accuracy, fairness, and robustness in federated networks. However, despite a plethora of work in this area, it remains unclear: (1) which personalization techniques are most effective in various settings, and (2) how important personalization truly is for realistic federated applications. To better answer these questions, we propose Motley, a benchmark for personalized federated learning. Motley consists of a suite of cross-device and cross-silo federated datasets from varied problem domains, as well as thorough evaluation metrics for better understanding the possible impacts of personalization. We establish baselines on the benchmark by comparing a number of representative personalized federated learning methods. These initial results highlight strengths and weaknesses of existing approaches, and raise several open questions for the community. Motley aims to provide a reproducible means with which to advance developments in personalized and heterogeneity-aware federated learning, as well as the related areas of transfer learning, meta-learning, and multi-task learning.

研究动机与目标

  • 为解决个性化联邦学习缺乏反映现实世界异构性和个性化挑战的标准化基准的问题。
  • 评估现有个性化联邦学习方法在多样化数据集和设置(包括跨设备和跨小样本联邦学习)中的有效性。
  • 突出文献中常被忽视的实际挑战,如超参数调优和模型泛化能力。
  • 提供可复现的开源基准,以推动个性化联邦学习、迁移学习、元学习和多任务学习的研究进展。
  • 建立超越平均准确率的系统化评估方案,强调公平性、通信效率和客户端层面性能。

提出的方法

  • Motley 构建了一个包含七个真实世界联邦学习数据集的基准套件——其中四个为跨设备,三个为跨小样本——数据源自公开来源,以反映自然的数据异构性。
  • 在模块化、可复现的代码库中实现了五种具有代表性的个性化联邦学习算法:FedAvg+微调、HypCluster、MTL、kNN-per 和本地训练。
  • 该基准包含标准化的数据预处理、超参数调优协议,以及涵盖客户端准确率、公平性(基尼指数)、通信成本和均方误差(MSE)的多维度评估。
  • 在跨设备设置中,由于本地数据集较小,采用全局超参数调优;而在跨小样本设置中,可实现客户端级调优,揭示了不同方法性能的关键差异。
  • 评估使用了诸如平均客户端准确率、准确率-通信比以及客户端指标差异等指标,以评估公平性和鲁棒性。
  • 该基准支持跨不同设置的系统性比较,并为个性化、泛化能力与部署复杂性之间的权衡提供了洞见。

实验结果

研究问题

  • RQ1在多样化的跨设备和跨小样本联邦学习设置中,哪些个性化联邦学习方法表现最佳,它们在不同评估指标下的表现如何比较?
  • RQ2评估指标的选择(例如平均准确率 vs. 公平性 vs. 通信效率)如何影响个性化联邦学习方法的排名?
  • RQ3在跨设备联邦学习中,由于本地数据集较小,超参数调优(尤其是受限条件下的调优)在多大程度上影响客户端性能和模型公平性?
  • RQ4像聚类(HypCluster)这样的个性化技术与更简单的集成或微调方法相比,在捕捉客户端数据分布方面表现如何?
  • RQ5个性化与泛化能力之间的实际权衡是什么?未来方法应如何更好地平衡这些方面?

主要发现

  • 在四个跨设备数据集中的三个中,FedAvg+微调实现了最佳的平均客户端准确率,并提升了公平性,但其性能对超参数调优极为敏感。
  • 在跨设备设置中,微调的全局超参数调优可能损害部分客户端的表现,表明在本地数据量小的客户端之间实现均衡个性化存在根本性挑战。
  • 在 TedMulti-EnEs 数据集上,HypCluster 实现了最高的平均客户端准确率,但在准确率-通信比方面表现不如 FedAvg+微调,并且相较于 FedAvg,使 40% 的客户端表现更差。
  • 在跨小样本设置中,FedAvg+微调和 MTL 在 Vehicle 和 School 数据集上均实现了最佳的平均客户端准确率,其中 MTL 所需超参数更少,潜在可扩展性更强。
  • 在 Vehicle 数据集上,本地训练的性能几乎与其它方法相当,同时提供了更强的隐私保护,表明在某些场景下它可能是一个实用的基线方法。
  • 该基准揭示,没有单一方法在所有情况下都是最优的——‘最佳’表现取决于评估指标,凸显了在个性化联邦学习中建立系统化、多准则评估框架的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。