[论文解读] Federated Learning on Non-IID Data: A Survey
本综述对联邦学习中的非独立同分布(non-iid)数据进行了全面分析,研究其在水平联邦学习与垂直联邦学习设置下对参数模型和非参数模型的影响。综述回顾了现有缓解数据偏移导致性能下降的技术,评估了其在隐私、计算和通信方面的权衡,并指出了个性化联邦学习、基准测试和联邦神经架构搜索中的关键开放挑战与未来研究方向。
Federated learning is an emerging distributed machine learning framework for privacy preservation. However, models trained in federated learning usually have worse performance than those trained in the standard centralized learning mode, especially when the training data are not independent and identically distributed (Non-IID) on the local devices. In this survey, we pro-vide a detailed analysis of the influence of Non-IID data on both parametric and non-parametric machine learning models in both horizontal and vertical federated learning. In addition, cur-rent research work on handling challenges of Non-IID data in federated learning are reviewed, and both advantages and disadvantages of these approaches are discussed. Finally, we suggest several future research directions before concluding the paper.
研究动机与目标
- 系统分析非独立同分布数据分布对水平联邦学习与垂直联邦学习框架下联邦学习性能的影响。
- 对现有处理非独立同分布数据的方法进行分类与评估,包括数据共享、知识蒸馏、个性化方法以及客户端聚类。
- 识别非独立同分布联邦学习设置下模型准确率、通信成本、计算开销与隐私泄露之间的关键权衡。
- 突出在垂直联邦学习与联邦神经架构搜索中,基准测试、隐私量化以及异构数据支持方面的开放挑战。
- 提出未来研究方向,包括标准化基准、隐私感知指标以及非独立同分布感知的联邦神经架构搜索。
提出的方法
- 将非独立同分布数据划分为水平联邦学习与垂直联邦学习设置,包括标签偏移、概念漂移与特征重叠等子类型。
- 分析非独立同分布数据对模型收敛性与性能的影响,尤其针对深度神经网络与非参数模型。
- 回顾并分类现有缓解技术,分为数据级、模型级与系统级方法,包括本地微调、客户端聚类与个性化联邦学习。
- 基于通信、计算与隐私的权衡评估各项技术,指出尽管许多方法提升了准确率,却往往增加了隐私风险。
- 提出一种基于真实世界数据分布与合成偏移方法的非独立同分布影响评估框架。
- 提出垂直联邦学习中非独立同分布场景的分类体系,包括特征重叠与众包偏移等此前文献中研究不足的类型。
实验结果
研究问题
- RQ1不同类型的非独立同分布数据分布(如标签偏移、特征偏移)如何影响水平联邦学习中的模型收敛性与性能?
- RQ2在非独立同分布联邦学习的缓解技术(如数据共享与知识蒸馏)中,性能提升与隐私风险之间的权衡为何显著?
- RQ3为何标准联邦平均算法在非独立同分布数据下会失效?本地模型中的权重发散现象如何产生?
- RQ4在具有重叠特征或异构特征的垂直联邦学习中,评估非独立同分布联邦学习性能的关键挑战是什么?
- RQ5如何使联邦神经架构搜索(FNAS)适应非独立同分布数据?该新兴领域中的开放研究问题有哪些?
主要发现
- 由于本地模型中的权重发散,非独立同分布数据显著降低了联邦学习的模型性能,尤其在深度神经网络中更为明显。
- 本地微调与数据共享等技术虽能改善收敛性,但通常会增加通信与计算开销,或损害数据隐私。
- 个性化与客户端聚类方法改变了原始联邦学习框架,使得单一全局模型无法适用于所有客户端。
- 现有非独立同分布联邦学习的基准测试不足,因合成数据划分无法真实反映现实世界中的数据偏移模式。
- 数据共享与知识蒸馏方法带来的隐私泄露缺乏量化测量,构成重大开放挑战。
- 尽管在现实应用中普遍存在,具有重叠特征或属性-标签偏移的垂直联邦学习仍缺乏充分研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。