[论文解读] Evaluation Framework For Large-scale Federated Learning
本文提出了一种用于大规模联邦学习的开源评估框架,具备模块化基准测试功能,支持自定义非独立同分布(non-IID)数据集和全面的评估指标。该框架引入了三种非IIDD数据生成方法——协变量偏移、先验概率偏移和概念偏移,并通过通信轮次、节点数量和数据质量等指标评估联邦学习算法,结果表明模型准确率随数据偏斜程度和错误率升高而下降。
Federated learning is proposed as a machine learning setting to enable distributed edge devices, such as mobile phones, to collaboratively learn a shared prediction model while keeping all the training data on device, which can not only take full advantage of data distributed across millions of nodes to train a good model but also protect data privacy. However, learning in scenario above poses new challenges. In fact, data across a massive number of unreliable devices is likely to be non-IID (identically and independently distributed), which may make the performance of models trained by federated learning unstable. In this paper, we introduce a framework designed for large-scale federated learning which consists of approaches to generating dataset and modular evaluation framework. Firstly, we construct a suite of open-source non-IID datasets by providing three respects including covariate shift, prior probability shift, and concept shift, which are grounded in real-world assumptions. In addition, we design several rigorous evaluation metrics including the number of network nodes, the size of datasets, the number of communication rounds and communication resources etc. Finally, we present an open-source benchmark for large-scale federated learning research.
研究动机与目标
- 为大规模联邦学习在非独立同分布(non-IID)数据条件下的缺乏标准化、可复现基准测试的问题提供解决方案。
- 设计并发布一个可扩展的开源框架,用于生成基于现实世界数据偏移的、逼真的非IIDD数据集。
- 开发一套超越准确率的全面评估指标,包括通信轮次、节点数量和数据质量因素。
- 在多种系统异构性和数据异构性设置下,实现联邦学习算法的公平、系统性比较。
- 通过提供开源代码、配置工具和数据集生成与基准测试的文档化工作流,支持可复现研究。
提出的方法
- 该框架通过三种机制生成非IIDD数据集:协变量偏移(随机划分)、先验概率偏移(基于标签的划分)和概念偏移(基于上下文重新定义标签)。
- 框架中的配置模块允许用户通过YAML配置文件自定义数据集参数,如节点数量、划分模式和数据偏斜水平。
- 评估指标不仅包括准确率,还涵盖通信轮次、网络节点数量、数据集大小和通信资源使用情况,实现对算法的全面评估。
- 该框架集成NEI(非IIDD评估)模块,基于节点级数据分布计算归一化误差指数,量化数据分布不平衡程度。
- 基准测试通过名为EFFL的模块化平台实现,包含基础服务、数据集生成、评估指标和配置文件模块,支持端到端可复现性。
- 系统支持主流数据集如MNIST和CIFAR-10,代码和数据集已发布在GitHub,供社区复用。
实验结果
研究问题
- RQ1如何通过现实世界中合理的数据偏移,系统化地生成并表征联邦学习中的非IIDD数据分布?
- RQ2在系统异构性条件下,除了标准准确率外,哪些评估指标是公平比较联邦学习算法所必需的?
- RQ3不同程度的数据偏斜(数量和标签分布)以及数据质量(如错误率)如何影响模型收敛性和性能?
- RQ4在不同非IIDD数据配置下,通信效率(通信轮次)与模型准确率之间的相关性如何?
- RQ5模块化、开源的基准测试框架在多样的实验设置下,能否实现联邦学习算法的可复现且可扩展的评估?
主要发现
- 在MNIST数据集上,当通信轮次为3000轮时,数量偏斜下的模型准确率达到96.33%,而标签分布偏斜下为93.44%。
- 在CIFAR-10数据集上,数量偏斜下的准确率达到95.94%(3000轮),而标签偏斜下仅为71.50%,表明标签不平衡具有更强的负面影响。
- 当总数据集中包含30%错误数据时,MNIST在标签分布偏斜下的模型准确率下降至84.33%,表明在数据质量较差时性能显著下降。
- 在所有设置下,更高的数据质量(更低错误率)和更均匀的数据分布(更低的N值,即每节点相同数据的比例)均能持续提升模型准确率。
- 该框架成功验证了通信效率和模型准确率对数据分布和系统配置高度敏感,证实了全面评估指标的必要性。
- 开源发布代码库和非IIDD数据集支持可复现的基准测试,并提供了数据集生成与评估的完整文档化工作流。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。