Skip to main content
QUICK REVIEW

[论文解读] Federated Learning from Only Unlabeled Data with Class-Conditional-Sharing Clients

N. Lu, Zhao Wang|arXiv (Cornell University)|Apr 7, 2022
Privacy-Preserving Technologies in Data被引用 6
一句话总结

本文提出FedUL,一种新颖的联邦学习框架,通过利用客户端之间的类别先验分布差异,在仅使用未标注数据的情况下实现监督分类器的训练。通过类别条件共享将未标注数据转换为代理标签数据,并引入固定转移层,FedUL确保理论上的收敛性至最优模型,并在基准数据集和真实世界医学影像数据集上实现了最先进性能,显著优于现有的无监督联邦学习基线方法。

ABSTRACT

Supervised federated learning (FL) enables multiple clients to share the trained model without sharing their labeled data. However, potential clients might even be reluctant to label their own data, which could limit the applicability of FL in practice. In this paper, we show the possibility of unsupervised FL whose model is still a classifier for predicting class labels, if the class-prior probabilities are shifted while the class-conditional distributions are shared among the unlabeled data owned by the clients. We propose federation of unsupervised learning (FedUL), where the unlabeled data are transformed into surrogate labeled data for each of the clients, a modified model is trained by supervised FL, and the wanted model is recovered from the modified model. FedUL is a very general solution to unsupervised FL: it is compatible with many supervised FL methods, and the recovery of the wanted model can be theoretically guaranteed as if the data have been labeled. Experiments on benchmark and real-world datasets demonstrate the effectiveness of FedUL. Code is available at https://github.com/lunanbit/FedUL.

研究动机与目标

  • 解决在客户端仅能获取未标注数据(由于标注成本高昂或隐私限制)时,训练准确分类器的挑战。
  • 开发一种与现有监督联邦学习方法兼容的通用解决方案,可在无需真实标签的情况下运行。
  • 在较弱的分布假设下,确保从未标注数据中理论上恢复最优全局模型。
  • 在标注成本高或受限的基准数据集和真实世界医学影像数据集上,验证方法的实证有效性。

提出的方法

  • 将每个客户端的未标注数据转换为代理标签数据,将每个数据子集的索引视为代理标签。
  • 在模型输出中引入一个固定、客户端特定的转移层,将代理类别后验概率映射到真实类别后验概率。
  • 利用客户端已知的类别先验概率定义单射转移函数,确保恢复过程中的模型保真度。
  • 对代理任务应用标准的监督联邦学习算法(例如FedAvg),实现客户端间的模型聚合。
  • 通过转移层的逆变换从代理模型中恢复最终分类器,确保理论收敛至真实模型。
  • 通过保持转移层固定且不学习,避免额外超参数调优,确保计算效率。

实验结果

研究问题

  • RQ1当客户端仅能访问未标注数据时,能否在联邦学习中训练监督分类器?
  • RQ2在何种分布假设下,可从未标注数据中恢复最优全局模型?
  • RQ3FedUL能否在保持隐私的前提下,实现与使用标注数据的监督联邦学习相当的性能?
  • RQ4在数据异构性不同的情况下,FedUL与现有无监督联邦学习基线方法在准确率和鲁棒性方面相比如何?
  • RQ5FedUL是否适用于并有效应用于医疗等真实世界、数据敏感的领域?

主要发现

  • 在RSNA颅内出血检测数据集上,FedUL在48个U集合、各医院平均准确率达到31.55%(±0.58),显著优于FedPL的31.44%。
  • 在CIFAR-100数据集上,FedUL在相同设置下达到31.48%(±2.25)的测试准确率,显著优于FedPL(31.44%)和FedLLP(30.99%)。
  • FedUL在仅使用10%标注数据的情况下,性能接近使用完整标注数据的监督FedAvg基线(准确率46.79%),表明其具有强大的标签效率。
  • 该方法在不同数量的未标注数据集(M=12, 24, 48)下均表现出鲁棒性,持续优于基线方法。
  • 理论分析保证:在已知类别先验和共享类别条件分布的温和条件下,FedUL恢复的模型可收敛至在完全标注数据上训练的最优模型。
  • 在真实世界医学影像数据上的实证结果证实,FedUL在标注成本高或受限的隐私敏感领域具有实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。