[论文解读] What Do We Mean by Generalization in Federated Learning?
本文提出一个框架,以解耦联邦学习中的两个独立泛化差距:样本外差距(参与客户端之间的性能差异)和参与差距(参与与非参与客户端之间的差异)。研究表明,在多种联邦学习数据集上,尤其是自然划分的数据中,显著的参与差距普遍存在。为此,本文提出语义划分——一种无需外部用户信息即可模拟真实世界数据分布模式的合成数据生成方法,从而在联邦学习中实现更真实的泛化研究。
Federated learning data is drawn from a distribution of distributions: clients are drawn from a meta-distribution, and their data are drawn from local data distributions. Thus generalization studies in federated learning should separate performance gaps from unseen client data (out-of-sample gap) from performance gaps from unseen client distributions (participation gap). In this work, we propose a framework for disentangling these performance gaps. Using this framework, we observe and explain differences in behavior across natural and synthetic federated datasets, indicating that dataset synthesis strategy can be important for realistic simulations of generalization in federated learning. We propose a semantic synthesis strategy that enables realistic simulation without naturally-partitioned data. Informed by our findings, we call out community suggestions for future federated learning works.
研究动机与目标
- 为解决联邦学习中泛化差距缺乏清晰区分的问题,特别是被忽视的参与差距。
- 将联邦数据建模为分布的分布,其中客户端从元总体中抽取,其数据从本地分布中抽取。
- 通过实证证明,参与差距显著影响模型性能,且在现有联邦学习评估框架中常被忽略。
- 提出一种语义划分策略,实现在无需自然划分数据的情况下,对泛化行为进行真实模拟。
- 基于对数据异质性和泛化行为的洞察,为未来联邦学习研究提供可操作的建议。
提出的方法
- 提出一种三路划分用于测量泛化:训练损失、样本外损失(在参与客户端上)、参与损失(在非参与客户端上)。
- 将参与差距定义为参与与非参与客户端之间期望风险的差异,使用客户端数据分布上的元分布进行形式化。
- 引入语义划分:一种合成数据生成方法,通过高斯混合模型基于语义相似性(如图像内容)对数据进行聚类,并利用基于KL散度的最优多部匹配。
- 使用变分自编码器(VAEs)结合IWAE-based熵估计,比较自然划分、语法划分和语义划分客户端之间的数据分布熵。
- 采用渐进式二部匹配启发式方法,高效求解多部匹配问题,最小化客户端聚类之间的KL散度。
- 在六个联邦学习任务(四个图像任务,两个文本任务)上,使用准确率和保留客户端数据上的损失等指标评估泛化差距。
实验结果
研究问题
- RQ1在自然划分和合成划分的联邦学习数据集中,样本外差距与参与差距在大小和行为上如何不同?
- RQ2数据异质性,特别是输入分布熵,在多大程度上解释了参与差距的存在及其大小?
- RQ3一种合成数据生成策略——语义划分——是否能在不依赖自然划分数据的情况下,产生与真实世界联邦数据相近的泛化行为?
- RQ4客户端数量和客户端多样性等因素如何影响参与差距的大小?
- RQ5忽略参与差距对联邦学习模型评估和未来联邦学习基准设计有何影响?
主要发现
- 在六个联邦学习任务中均存在显著的参与差距,图像和文本任务中参与与非参与客户端之间的准确率差异常超过10%。
- 自然划分的数据集客户端数据熵较低(40 Nats),而合成划分的数据集熵较高(50 Nats),表明真实世界数据中存在更强的数据相关性和非独立同分布结构。
- 语义划分显著缩小了合成数据与真实世界泛化行为之间的差距,实现中间熵值(45 Nats),并更真实地模拟真实数据分布。
- 基于标签的划分导致的参与差距高于语义划分,原因在于虚假相关性和非独立同分布的数据模式。
- 参与差距与数据异质性密切相关,特别是输入分布熵,是联邦学习中一个关键但此前被忽视的泛化维度。
- 本研究揭示,许多现有联邦学习基准因数据划分策略过于简化,尤其是依赖基于标签的划分,而未能捕捉真实的泛化行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。