Skip to main content
QUICK REVIEW

[论文解读] FedSiam: Towards Adaptive Federated Semi-Supervised Learning

Zewei Long, Liwei Che|arXiv (Cornell University)|Dec 6, 2020
Privacy-Preserving Technologies in Data参考文献 48被引用 10
一句话总结

FedSiam 提出了一种新颖的联邦半监督学习框架,通过引入带有动量更新的孪生网络,提升了模型的泛化能力,并有效处理了在客户端和服务器端均有标签数据的非独立同分布(non-IID)数据场景。通过基于逐层权重差异的自适应层选择机制,FedSiam 提升了通信效率,并在多个数据集和数据分布设置下实现了最先进性能。

ABSTRACT

Federated learning (FL) has emerged as an effective technique to co-training machine learning models without actually sharing data and leaking privacy. However, most existing FL methods focus on the supervised setting and ignore the utilization of unlabeled data. Although there are a few existing studies trying to incorporate unlabeled data into FL, they all fail to maintain performance guarantees or generalization ability in various real-world settings. In this paper, we focus on designing a general framework FedSiam to tackle different scenarios of federated semi-supervised learning, including four settings in the labels-at-client scenario and two setting in the labels-at-server scenario. FedSiam is built upon a siamese network into FL with a momentum update to handle the non-IID challenges introduced by unlabeled data. We further propose a new metric to measure the divergence of local model layers within the siamese network. Based on the divergence, FedSiam can automatically select layer-level parameters to be uploaded to the server in an adaptive manner. Experimental results on three datasets under two scenarios with different data distribution settings demonstrate that the proposed FedSiam framework outperforms state-of-the-art baselines.

研究动机与目标

  • 解决在联邦学习中利用未标记数据的挑战,同时在非独立同分布数据分布下保持性能和泛化能力。
  • 克服现有联邦半监督学习(FedSSL)方法在复杂数据分布设置下存在的过拟合伪标签或鲁棒性不足的局限性。
  • 提出一种可泛化的框架,适用于多种联邦半监督学习场景,包括标签在客户端和标签在服务器端的情况,且在独立同分布(IID)和非独立同分布(non-IID)条件下均有效。
  • 引入一种新颖的自适应层选择机制,通过仅上传最具信息量的模型层来减少通信开销。
  • 通过基于动量的更新策略增强模型鲁棒性,以在统计数据异构性存在的情况下稳定训练。

提出的方法

  • 采用孪生网络架构,其中两个相同的分支共享权重,实现同一输入在不同视图之间的一致性正则化。
  • 在孪生框架中应用动量更新机制,以稳定目标网络,减少分布偏移并提升训练稳定性。
  • 设计一种逐层权重差异度量方法,用于量化两个孪生分支对应层之间的差异,从而实现自适应模型压缩。
  • 利用该差异度量动态选择上传至服务器的层,以在保持模型性能的同时降低通信成本。
  • 通过结合分类损失和一致性损失训练本地模型,并使用停止梯度操作解耦有标签和无标签学习路径。
  • 通过相应调整训练和聚合过程,同时支持标签在客户端和标签在服务器端的场景,后者包括服务器端的模型更新。

实验结果

研究问题

  • RQ1当客户端同时拥有有标签和无标签数据时,如何使联邦半监督学习在非独立同分布数据分布下具备鲁棒性?
  • RQ2带有动量更新的孪生网络架构能否在联邦半监督学习中提升泛化能力并减少过拟合?
  • RQ3在联邦学习中,如何设计一种有效且自适应的机制,以选择通信的模型层,从而在性能和通信成本之间取得平衡?
  • RQ4所提出的 FedSiam 框架在多种数据分布设置下(包括 IID 和 non-IID 场景)的表现如何?
  • RQ5该框架是否能泛化到不同的 FedSSL 设置中,包括标签在服务器端(客户端不可用标签数据)的场景?

主要发现

  • 在 MNIST、CIFAR-10 和 SVHN 三个基准数据集上,FedSiam 在 IID 和 Non-IID 数据分布设置下均优于最先进基线方法。
  • 在 Non-IID-I 设置下,FedSiam 使用 KL 散度损失在 CIFAR-10 上达到 48.11% 的准确率,显著优于使用 MSE 损失的基线方法(41.09%)的性能。
  • 在 MNIST 和 SVHN 的 Non-IID-I 设置下,FedSiam 使用 MSE 损失分别达到 95.61% 和 81.61% 的准确率,超越了现有基线方法。
  • 自适应层选择机制通过仅上传高差异度的层,显著降低了通信开销,提升了效率,且未牺牲准确率。
  • 动量更新策略稳定了训练过程并提升了收敛性,尤其在数据异构性较高的非独立同分布设置下表现突出。
  • FedSiam 在标签在客户端和标签在服务器端的两种场景下均展现出强大的泛化能力,验证了其在真实联邦学习约束下的鲁棒性与适应性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。