Skip to main content
QUICK REVIEW

[论文解读] Client Selection in Federated Learning based on Gradients Importance

Ouiame Marnissi, Hajar El Hammouti|arXiv (Cornell University)|Nov 19, 2021
Privacy-Preserving Technologies in Data被引用 4
一句话总结

本文提出了一种联邦学习中的客户端选择策略,该策略基于本地梯度的L2范数选择设备,以提升通信效率和收敛速度。通过优先选择梯度范数最高的客户端,该方法在非独立同分布(non-iid)数据条件下显著提升了测试准确率——在150轮训练时最高提升达14%,同时仅需在梯度范数计算之外增加极少的额外计算开销。

ABSTRACT

Federated learning (FL) enables multiple devices to collaboratively learn a global model without sharing their personal data. In real-world applications, the different parties are likely to have heterogeneous data distribution and limited communication bandwidth. In this paper, we are interested in improving the communication efficiency of FL systems. We investigate and design a device selection strategy based on the importance of the gradient norms. In particular, our approach consists of selecting devices with the highest norms of gradient values at each communication round. We study the convergence and the performance of such a selection technique and compare it to existing ones. We perform several experiments with non-iid set-up. The results show the convergence of our method with a considerable increase of test accuracy comparing to the random selection.

研究动机与目标

  • 解决因带宽受限和数据分布异构性导致的联邦学习通信效率低下问题。
  • 通过智能客户端选择,在非独立同分布(non-iid)数据设置下提升收敛速度与模型准确率。
  • 通过避免昂贵的损失计算,在保持与基于损失的选择方法相当性能的同时,降低计算开销。
  • 为所提出的客户端选择机制提供理论收敛保证。
  • 通过实验评估客户端选择数量对多种数据集上模型性能的影响。

提出的方法

  • 该方法在每轮通信中基于客户端本地梯度向量的L2范数选择客户端。
  • 梯度范数最高的客户端被优先选中参与训练,假设其对模型更新的贡献更大。
  • 选择过程轻量化,仅需计算梯度范数,无需额外的损失评估。
  • 该方法被整合进联邦平均(Federated Averaging)框架中,被选中的客户端将梯度发送至服务器进行聚合。
  • 理论分析支持在所提出的选中规则下实现收敛,尤其在非独立同分布(non-iid)设置下。
  • 实验在MNIST、FMNIST和CIFAR-10数据集上对比了该方法与随机选择及最高损失选择策略的性能。

实验结果

研究问题

  • RQ1基于梯度范数大小选择客户端是否能提升联邦学习中的收敛速度与测试准确率?
  • RQ2与随机选择和基于损失的选择相比,基于梯度范数的选择在性能与计算成本方面表现如何?
  • RQ3在不同数据集与数据异构性水平下,选择多少客户端能实现最佳模型准确率?
  • RQ4与基于损失的选择相比,所提出方法是否在极低额外计算开销下仍保持优异性能?
  • RQ5数据异构性(由β控制)如何影响基于梯度范数选择方法的相对性能?

主要发现

  • 在150轮通信后,基于梯度范数的选择在MNIST数据集上(β=0.3)实现了81.6%的测试准确率,相比随机选择提升了14%。
  • 在同一数据集上,该方法在第150轮迭代时相比随机选择将训练损失降低了8%。
  • 当数据异构性较低(β=5)时,随机选择的性能几乎与所提方法相当,表明在数据分布较均衡时该方法的优势减弱。
  • 在FMNIST数据集上,通过梯度范数选择15台设备,在第150轮达到71.6%的准确率,优于其他选择数量。
  • 在FMNIST上选择85台设备时,基于梯度范数的选择与基于损失的选择性能几乎完全一致,表明在高参与率下二者具有相当的效率。
  • 在MNIST和CIFAR-10上,选择25台设备时准确率最高;而在FMNIST上,选择15台设备为最优,表明最优选择规模依赖于数据集特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。