Skip to main content
QUICK REVIEW

[论文解读] FedMAX: Mitigating Activation Divergence for Accurate and Communication-Efficient Federated Learning

Wei Chen, Kartikeya Bhardwaj|arXiv (Cornell University)|Apr 7, 2020
Privacy-Preserving Technologies in Data参考文献 20被引用 10
一句话总结

FedMAX 提出了一种新颖的联邦学习框架,通过在本地激活向量上施加最大熵先验,缓解了由非独立同分布(non-IID)数据引起的激活值差异问题,从而提升设备间的相似性。该方法在 CIFAR-10、CIFAR-100、FEMNIST 和医疗数据集上,相较于 FedAvg 和 FedProx,实现了更高的准确率,并将通信轮次减少最多 5 倍。

ABSTRACT

In this paper, we identify a new phenomenon called activation-divergence which occurs in Federated Learning (FL) due to data heterogeneity (i.e., data being non-IID) across multiple users. Specifically, we argue that the activation vectors in FL can diverge, even if subsets of users share a few common classes with data residing on different devices. To address the activation-divergence issue, we introduce a prior based on the principle of maximum entropy; this prior assumes minimal information about the per-device activation vectors and aims at making the activation vectors of same classes as similar as possible across multiple devices. Our results show that, for both IID and non-IID settings, our proposed approach results in better accuracy (due to the significantly more similar activation vectors across multiple devices), and is more communication-efficient than state-of-the-art approaches in FL. Finally, we illustrate the effectiveness of our approach on a few common benchmarks and two large medical datasets.

研究动机与目标

  • 解决因非独立同分布数据导致的联邦学习中激活值差异问题,即尽管共享类别标签,不同设备上同一类别的激活向量仍变得不相似。
  • 在独立同分布(IID)和非独立同分布(non-IID)设置下,通过在不依赖共享全局数据的前提下对齐设备间的激活表示,提升模型准确率。
  • 通过允许更长的本地训练周期而不引起准确率下降,提升通信效率,从而减少通信轮次。
  • 提供一种隐私保护方案,避免数据共享,同时在真实世界和医疗数据集上保持高性能。

提出的方法

  • 引入最大熵先验,假设对每个设备的激活向量信息最少,从而促进同一类别在不同设备间实现均匀性和相似性。
  • 构建一个正则化损失函数,将标准交叉熵损失与对激活向量的 L2 范数惩罚相结合,以鼓励紧凑且相似的表示。
  • 应用最大熵原理,约束激活分布使其在满足设备间类别标签匹配的前提下尽可能均匀。
  • 在每次通信轮次中,使用新引入的先验训练本地模型,然后通过类似 FedAvg 的平均方法聚合全局模型权重。
  • 使用 t-SNE 可视化分析 FedMAX 与 FedAvg 在设备间激活向量聚类情况的差异,证明了其在对齐性上的改进。
  • 在独立同分布(IID)和非独立同分布(non-IID)数据划分下评估该方法,涵盖真实世界基准和两个大型医疗数据集(APTOS 和 Chest X-ray)。

实验结果

研究问题

  • RQ1在非独立同分布联邦学习中,激活值差异在用户共享共同类别的情况下,对模型准确率的损害程度如何?
  • RQ2在本地激活向量上强制施加最大熵先验,是否能减少设备间的差异并提升模型泛化能力?
  • RQ3FedMAX 在不同数据集上的测试准确率和通信效率方面,与 FedAvg 和 FedProx 相比表现如何?
  • RQ4在数据共享不可行的隐私敏感型医疗数据集上,FedMAX 是否能保持性能优势?
  • RQ5所提出的方法是否能减少达到目标准确率所需的通信轮次,而不会牺牲模型性能?

主要发现

  • 在非独立同分布设置下,FedMAX 在 CIFAR-10 数据集上的测试准确率比 FedAvg 高出 5.64% 至 5.84%。
  • 在 CIFAR-10 上,FedMAX 相较于 FedAvg 和 FedProx,将通信轮次最多减少 5 倍,同时保持或提升准确率。
  • t-SNE 可视化显示,FedMAX 中同一类别的激活向量在不同设备间聚类更紧密,尤其在训练 6–15 个周期后表现更明显。
  • 在 FEMNIST 和 CIFAR-100 数据集上,FedMAX 在 IID 和非独立同分布设置下均优于 FedAvg 和 FedProx,且在准确率和通信效率方面保持一致优势。
  • 在 APTOS 医疗数据集(IID)上,FedMAX 显著优于 FedAvg;而在数据量较小的 Chest X-ray 数据集上,性能与 FedAvg 相当,原因在于数据量有限导致的差异较小。
  • 对激活向量施加 L2 正则化在医疗数据集上显著提升性能,而在 CIFAR-10 上则表现较差,表明该方法对数据集具有特定敏感性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。