Skip to main content
QUICK REVIEW

[论文解读] FOCUS: Dealing with Label Quality Disparity in Federated Learning

Yiqiang Chen, Xiaodong Yang|arXiv (Cornell University)|Jan 29, 2020
Stochastic Gradient Optimization Techniques参考文献 8被引用 39
一句话总结

FOCUS 能在联邦学习中检测并降低带有噪声标签的客户端权重,方法是使用基准数据集和互熵交叉熵可信度得分来进行可信度加权聚合。在存在标签噪声时,其性能优于 FedAvg。

ABSTRACT

Ubiquitous systems with End-Edge-Cloud architecture are increasingly being used in healthcare applications. Federated Learning (FL) is highly useful for such applications, due to silo effect and privacy preserving. Existing FL approaches generally do not account for disparities in the quality of local data labels. However, the clients in ubiquitous systems tend to suffer from label noise due to varying skill-levels, biases or malicious tampering of the annotators. In this paper, we propose Federated Opportunistic Computing for Ubiquitous Systems (FOCUS) to address this challenge. It maintains a small set of benchmark samples on the FL server and quantifies the credibility of the client local data without directly observing them by computing the mutual cross-entropy between performance of the FL model on the local datasets and that of the client local FL model on the benchmark dataset. Then, a credit weighted orchestration is performed to adjust the weight assigned to clients in the FL model based on their credibility values. FOCUS has been experimentally evaluated on both synthetic data and real-world data. The results show that it effectively identifies clients with noisy labels and reduces their impact on the model performance, thereby significantly outperforming existing FL approaches.

研究动机与目标

  • 动机:在普遍存在的端-边-云系统中,尤其是在医疗保健领域,解决联邦学习中的标签质量差异的必要性。
  • 提出一种隐私保护机制,在不访问原始数据的情况下测量本地数据质量。
  • 开发一种机会性聚合方案,按可信度分数对客户端更新进行加权。
  • 在合成数据和真实世界医疗数据集上评估 FOCUS,以证明其对噪声标签的鲁棒性。

提出的方法

  • 在 FL 服务器上维护一个标注准确的小型基准数据集。
  • 客户端训练局部模型,服务器在基准数据集上评估局部模型以获得 LS^k。
  • 服务器在每个客户端的本地数据上评估全局模型以获得 LL^k。
  • 通过 E^k = LS^k + LL^k,利用 C^k = 1 - exp(alpha E^k) / sum_i exp(alpha E^i) 来计算可信度 C^k。
  • 使用基于可信度的 FedAvg 进行聚合:M^s_t = sum_k W^k_{t-1} M^k_t,其中 W^k_t = n_k C^k_t / sum_i (n_i C^i_t)。
  • 通过使权重之和为一并利用现有的 FedAvg 收敛性质来确保收敛。

实验结果

研究问题

  • RQ1在传统的 FedAvg 聚合下,本地数据集中的标签噪声是否会降低联邦学习的性能?
  • RQ2基于可信度的互熵交叉熵测量是否能够在不访问原始数据的情况下有效识别带标签噪声的客户端?
  • RQ3基于可信度加权的聚合是否在保留对准确数据的性能的同时缓解对带噪声客户端的影响?
  • RQ4将基准评估并入联邦学习对通信成本有何影响?

主要发现

  • FOCUS 可以通过在基准数据和客户端数据上比较本地和全局模型的表现来识别带噪声的客户端,从而在聚合中减少它们的影响。
  • 在正常条件下(标签全部正确),FOCUS 的性能与 FedAvg 相当;在噪声标签条件下,FOCUS 在 USC-HAD 上的准确率比 FedAvg 高出 5.82%。
  • FOCUS 会给带噪声的客户端分配较低的权重,例如在一个例子中,权重较低的医院获得了较低的可信度。
  • FOCUS 的收敛与 FedAvg 相似,在某些场景下甚至可以更快收敛,同时减少对带噪声数据的过拟合。
  • 在 PD-Tremor 上的实验表明 FOCUS 比 FedAvg 高出 7.24% 的准确率,表明对现实世界数据中的标签噪声具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。