Skip to main content
QUICK REVIEW

[论文解读] DELTA: Diverse Client Sampling for Fasting Federated Learning

Lin Wang, Yongxin Guo|arXiv (Cornell University)|May 27, 2022
Privacy-Preserving Technologies in Data被引用 8
一句话总结

DELTA 提出了一种无偏且多样化的客户端采样策略,通过选择梯度范数高且梯度相似性低的客户端来加速联邦学习的收敛。通过最小化部分参与带来的方差并利用客户端多样性,DELTA 在多个数据集和优化器上均实现了比 FedAvg、FedIS 和基于聚类的 IS 更快的收敛速度和更高的准确率。

ABSTRACT

Partial client participation has been widely adopted in Federated Learning (FL) to reduce the communication burden efficiently. However, an inadequate client sampling scheme can lead to the selection of unrepresentative subsets, resulting in significant variance in model updates and slowed convergence. Existing sampling methods are either biased or can be further optimized for faster convergence.In this paper, we present DELTA, an unbiased sampling scheme designed to alleviate these issues. DELTA characterizes the effects of client diversity and local variance, and samples representative clients with valuable information for global model updates. In addition, DELTA is a proven optimal unbiased sampling scheme that minimizes variance caused by partial client participation and outperforms other unbiased sampling schemes in terms of convergence. Furthermore, to address full-client gradient dependence,we provide a practical version of DELTA depending on the available clients' information, and also analyze its convergence. Our results are validated through experiments on both synthetic and real-world datasets.

研究动机与目标

  • 解决部分参与联邦学习中因客户端采样缺乏代表性而导致的收敛缓慢和方差高的问题。
  • 克服现有无偏采样方法(如重要性采样 IS 和基于聚类的 IS)的局限性,这些方法在后期阶段存在冗余更新或收敛缓慢的问题。
  • 设计一种采样方案,平衡高梯度范数与低梯度相似性,以确保客户端更新的多样性与信息量。
  • 提出一种仅依赖可用客户端信息、无需完整客户端梯度的实用版本,确保收敛性保障。
  • 在多个数据集、模型架构和优化算法(如 Adam、Adagrad)上验证 DELTA 的有效性。

提出的方法

  • DELTA 将客户端采样建模为一个优化问题,旨在部分客户端参与的条件下最小化全局模型更新的方差。
  • 通过结合高本地梯度范数与与已选客户端的低相关性来选择客户端,以促进多样性。
  • 该方法采用贪心选择策略,计算一个融合梯度大小与与已选客户端相似性的多样性感知得分。
  • 提出一种实用变体 FedPracDELTA,仅依赖可访问的客户端信息(如活跃客户端的本地梯度),避免计算完整梯度。
  • 理论分析证明,DELTA 是最小化方差的最优无偏采样方案,在温和假设下推导出收敛速率。
  • 将 DELTA 集成到 FedAvg 中形成 FedDELTA,并在实验中与 FedIS 和 FedAvg 进行比较。

实验结果

研究问题

  • RQ1一种在梯度大小与梯度多样性之间取得平衡的客户端采样策略,是否能在收敛速度和准确率方面优于均匀采样和重要性采样?
  • RQ2DELTA 在处理数据异质性并减少冗余更新方面,与基于聚类的 IS 和标准 IS 相比表现如何?
  • RQ3当无法获取完整客户端梯度时,DELTA 的实用版本(FedPracDELTA)是否仍能保持收敛性保障和性能?
  • RQ4在不同非独立同分布数据分布下,DELTA 对数据异质性水平(由 α 控制)的变化有多强的鲁棒性?
  • RQ5DELTA 是否能与方差减少技术(如 FedVARP)有效结合,或可适配非标准优化器(如 Adam 和 Adagrad)?

主要发现

  • 在非独立同分布 MNIST 上,DELTA 仅用 252 轮通信达到 65% 准确率,优于 FedAvg(390 轮)和 FedIS(266 轮)。
  • 在 FashionMNIST 上(α=0.1),DELTA 用 436 轮达到 74.22% 准确率,优于 FedVARP(470 轮)和 FedIS+VARP(452 轮)。
  • 在 CelebA 上使用 Adam 优化器,DELTA 用 109 轮达到 80% 准确率,而 FedAvg 为 244 轮,FedIS 为 140 轮,速度提升 2.24 倍。
  • 消融实验表明,DELTA 在不同数据异质性水平(α = 0.1 至 1.0)下始终优于 FedIS 和 FedAvg,准确率提升最高达 0.7%。
  • 与 FedVARP 结合时,DELTA + FedVARP 在 FashionMNIST 上用 436 轮达到 74.22% 准确率,证明了兼容性与叠加优势。
  • 在 FEMNIST 上使用 Adam 优化器,DELTA 用 109 轮达到 90.58% 准确率,显著优于 FedAvg(244 轮时 89.04%)和 FedIS(140 轮时 89.92%)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。