Skip to main content
QUICK REVIEW

[论文解读] Estimation of Individual Device Contributions for Incentivizing Federated Learning

Takayuki Nishio, Ryoichi Shinkuma|arXiv (Cornell University)|Sep 20, 2020
Privacy-Preserving Technologies in Data参考文献 22被引用 4
一句话总结

该论文提出了一种计算和通信开销低效的方法,通过在单轮联邦学习(FL)训练过程中利用模型性能提升指标,估算各参与设备的贡献度。与基线方法相比,该方法将计算开销减少了46–49%,通信开销为零,同时在MNIST数据集上保持了高估计算准确性。

ABSTRACT

Federated learning (FL) is an emerging technique used to train a machine-learning model collaboratively using the data and computation resource of the mobile devices without exposing privacy-sensitive user data. Appropriate incentive mechanisms that motivate the data and mobile-device owner to participate in FL is key to building a sustainable platform for FL. However, it is difficult to evaluate the contribution level of the devices/owners to determine appropriate rewards without large computation and communication overhead. This paper proposes a computation-and communication-efficient method of estimating a participating device's contribution level. The proposed method enables such estimation during a single FL training process, there by reducing the need for traffic and computation overhead. The performance evaluations using the MNIST dataset show that the proposed method estimates individual participants' contributions accurately with 46-49% less computation overhead and no communication overhead than a naive estimation method.

研究动机与目标

  • 为了解决如何公平奖励移动设备所有者参与联邦学习的问题,以激励其参与。
  • 在不产生高计算或通信开销的前提下,准确估算单个设备的贡献度。
  • 在单次FL训练过程中实现贡献度估算,避免因移除每个客户端后重复进行完整的FL训练。
  • 在客户端数据分布不均衡和非独立同分布(non-i.i.d.)的情况下,仍能保证估计算准确度。
  • 为可持续的联邦学习平台提供可扩展且实用的激励机制。

提出的方法

  • 该方法基于全局模型准确率在每次客户端更新被聚合后所发生的变化,采用分步改进指标来估算贡献度。
  • 通过测量当每个客户端的模型更新被添加到全局模型时,模型性能的边际增益,来计算贡献度评分。
  • 估算过程在单次FL训练过程中完成,避免了在移除每个客户端后重复训练模型的需求。
  • 该方法通过基于梯度的贡献度估算,对Shapley值进行可微分近似,从而降低计算成本。
  • 通过不额外交换模型参数,避免了通信开销,仅依赖标准FL训练过程中的通信。
  • 该方法设计轻量化,与标准FL相比,额外计算时间可忽略不计(仅数百微秒)。

实验结果

研究问题

  • RQ1如何在最小化计算和通信开销的前提下,估算联邦学习中各设备的贡献度?
  • RQ2单次遍历的FL训练过程能否在不重新训练的情况下,支持准确的贡献度估算?
  • RQ3与需要重复完整FL训练的基线方法相比,所提方法在准确性和效率方面表现如何?
  • RQ4数据多样性与类别不平衡对贡献度估算有何影响?该方法如何应对这些情况?
  • RQ5当客户端贡献的数据量较小或数据不具唯一性时,该方法是否仍能保持高估计算准确性?

主要发现

  • 与需要为每个客户端移除操作重新训练完整模型的基线方法相比,所提方法将计算开销降低了46–49%。
  • 该方法未引入额外通信开销,而基线方法因需多次完整FL训练周期而产生显著通信成本。
  • 在MNIST数据集上,所提方法的贡献度评分估计算与基线“朴素方法”的真实值非常接近,当客户端数据量较大时,平均误差仅为1.80。
  • 当客户端数据量较小时(如50个样本),所提方法的误差较高(3.57),但该现象归因于小规模、多样化数据贡献带来的不稳定性。
  • 该方法正确地为拥有独特数据的客户端(如数字7–9)分配了更高的评分,而对数据重叠的客户端分配了较低评分,显示出对数据唯一性的敏感性。
  • 该方法的计算时间与标准FL几乎完全一致,仅因贡献度追踪引入了微小增加,证实了其高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。