Skip to main content
QUICK REVIEW

[论文解读] FedSEAL: Semi-Supervised Federated Learning with Self-Ensemble Learning and Negative Learning

Jieming Bian, Zhu Fu|arXiv (Cornell University)|Oct 15, 2021
Privacy-Preserving Technologies in Data参考文献 29被引用 5
一句话总结

FedSEAL 提出了一种新颖的半监督联邦学习框架,通过自集成学习和负样本学习,有效利用未标记客户端数据与有限的标记服务器数据,显著提升模型准确率。通过动态置信度阈值和互补标签机制,该方法在早期训练阶段即展现出远超当前最先进方法的性能,显著稳定并增强了无监督学习效果。

ABSTRACT

Federated learning (FL), a popular decentralized and privacy-preserving machine learning (FL) framework, has received extensive research attention in recent years. The majority of existing works focus on supervised learning (SL) problems where it is assumed that clients carry labeled datasets while the server has no data. However, in realistic scenarios, clients are often unable to label their data due to the lack of expertise and motivation while the server may host a small amount of labeled data. How to reasonably utilize the server labeled data and the clients' unlabeled data is thus of paramount practical importance. In this paper, we propose a new FL algorithm, called FedSEAL, to solve this Semi-Supervised Federated Learning (SSFL) problem. Our algorithm utilizes self-ensemble learning and complementary negative learning to enhance both the accuracy and the efficiency of clients' unsupervised learning on unlabeled data, and orchestrates the model training on both the server side and the clients' side. Our experimental results on Fashion-MNIST and CIFAR10 datasets in the SSFL setting validate the effectiveness of our method, which outperforms the state-of-the-art SSFL methods by a large margin.

研究动机与目标

  • 解决实际的半监督联邦学习挑战:客户端拥有未标记数据,而服务器仅持有少量标记数据。
  • 克服因联邦学习去中心化特性与数据分布不均导致的无监督学习中误差累积问题。
  • 通过在服务器标记数据上进行监督学习、在客户端未标记数据上进行无监督学习,提升模型泛化能力与训练稳定性。
  • 开发一种方法,有效利用海量未标记客户端数据,同时保持隐私保护与去中心化特性。
  • 在性能上显著优于现有半监督联邦学习基线方法,包括那些仅在服务器数据上简单监督学习基础上略有提升的方法。

提出的方法

  • 在每个客户端维护历史模型集成,通过自集成学习计算未标记数据的平均置信度分数。
  • 利用服务器评估的置信度分数阈值,将高质量伪标签实例过滤至正向过滤数据集,用于监督训练。
  • 通过为未标记数据分配互补标签引入负样本学习,并构建第二个过滤数据集以稳定早期训练。
  • 实施类别自适应的动态置信度阈值,根据每类置信度分布动态调整,防止数据集不平衡并减少噪声伪标签。
  • 协调交替训练:在服务器上使用标记数据进行监督学习,在客户端上使用正向与负向过滤数据集进行无监督学习。
  • 应用一致性正则化与伪标签技术,提升泛化能力并减少早期训练阶段的误差传播。

实验结果

研究问题

  • RQ1自集成学习是否能通过利用模型集成提升半监督联邦学习中伪标签的质量?
  • RQ2使用互补标签的负样本学习在联邦学习早期阶段如何增强训练稳定性和性能?
  • RQ3与固定阈值相比,类别自适应的动态置信度阈值在缓解数据不平衡与减少噪声伪标签方面效果如何?
  • RQ4FedSEAL 是否能显著超越现有 SSFL 方法,特别是在服务器仅拥有少量标记数据集时?
  • RQ5自集成与负样本学习的结合如何影响真实数据集(如 CIFAR10 与 Fashion-MNIST)中的收敛速度与最终准确率?

主要发现

  • 在 CIFAR10 上,FedSEAL 显著优于当前最先进方法 FedMatch(已修正)与 FedRGD,甚至超越了无数据增强的 Server-SL 基线模型。
  • 在 Fashion-MNIST 上,FedSEAL 的收敛速度更快且测试准确率高于不使用自集成学习的 FedSEAL 版本,验证了基于集成的过滤机制的有效性。
  • 正向过滤数据集中正确伪标签的比例显著低于负向数据集中互补标签的比例,证实了负样本学习在稳定早期训练中的必要性。
  • 类别自适应的动态置信度阈值可有效防止过滤数据集中出现严重类别不平衡,而固定阈值(如 0.9 或 0.5)会导致低置信度类别过滤效果差。
  • 自集成学习的使用显著增加了过滤数据集中高质量伪标签实例的数量,从而实现更快收敛与更好泛化能力。
  • 即使服务器仅有 1,000 个标记样本,FedSEAL 仍能实现卓越性能,证明其在低数据场景下有效利用客户端未标记数据的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。