Skip to main content
QUICK REVIEW

[论文解读] Federated Nonconvex Sparse Learning

Qianqian Tong, Guannan Liang|arXiv (Cornell University)|Dec 31, 2020
Sparse and Compressive Sensing Techniques参考文献 34被引用 5
一句话总结

本文提出了联邦硬阈值化(Fed-HT)和联邦迭代硬阈值化(FedIter-HT),两种在去中心化、非独立同分布(non-IID)数据的联邦设置下进行非凸稀疏学习的通信高效算法。两种方法均实现线性收敛,并保证最优稀疏估计器的恢复,相比分布式IHT方法显著减少了通信轮次,同时保持高精度。

ABSTRACT

Nonconvex sparse learning plays an essential role in many areas, such as signal processing and deep network compression. Iterative hard thresholding (IHT) methods are the state-of-the-art for nonconvex sparse learning due to their capability of recovering true support and scalability with large datasets. Theoretical analysis of IHT is currently based on centralized IID data. In realistic large-scale situations, however, data are distributed, hardly IID, and private to local edge computing devices. It is thus necessary to examine the property of IHT in federated settings, which update in parallel on local devices and communicate with a central server only once in a while without sharing local data. In this paper, we propose two IHT methods: Federated Hard Thresholding (Fed-HT) and Federated Iterative Hard Thresholding (FedIter-HT). We prove that both algorithms enjoy a linear convergence rate and have strong guarantees to recover the optimal sparse estimator, similar to traditional IHT methods, but now with decentralized non-IID data. Empirical results demonstrate that the Fed-HT and FedIter-HT outperform their competitor - a distributed IHT, in terms of decreasing the objective values with lower requirements on communication rounds and bandwidth.

研究动机与目标

  • 解决在数据去中心化、非独立同分布且注重隐私的联邦学习环境中,非凸稀疏学习的挑战。
  • 克服现有IHT方法在真实联邦学习环境中对集中式、独立同分布(I.I.D.)数据的假设限制。
  • 设计通信高效的算法,以减少通信轮次和带宽使用,同时保持收敛性和稀疏性恢复能力。
  • 在非I.I.D.、去中心化的数据分布下,理论上保证线性收敛和最优稀疏估计器的恢复。
  • 通过实证验证,所提方法在更少通信轮次下,相比分布式IHT在目标函数值减少方面表现更优。

提出的方法

  • 提出Fed-HT,即在中央服务器聚合本地模型更新后应用硬阈值化操作,从而降低每轮通信负载。
  • 提出FedIter-HT,即在每次本地更新后于每个本地客户端应用硬阈值化操作,实现更频繁的稀疏性强制。
  • 通过适配标准IHT更新方式,将迭代硬阈值化集成到联邦学习中:$x_{t+1} = \tilde{\tau}(x_t - \tilde{\rho}_t v_t)$,其中$\tilde{\tau}$为硬阈值化算子,仅保留最大的$\tau$个元素。
  • 在FedIter-HT中引入类似邻近的正则化项,以稳定训练并减少非I.I.D.设置下的客户端漂移。
  • 通过最小化往返通信次数确保通信效率:客户端在发送更新前进行多步本地训练。
  • 理论分析表明,两种算法在非I.I.D.数据下均实现线性收敛,收敛速率取决于条件数和稀疏度水平。

实验结果

研究问题

  • RQ1能否在去中心化、非I.I.D.数据的联邦学习环境中,对迭代硬阈值化(IHT)方法进行适配,同时保持收敛性和稀疏性保证?
  • RQ2Fed-HT与FedIter-HT在通信效率和收敛速度方面与标准分布式IHT相比如何?
  • RQ3非I.I.D.数据分布对联邦IHT算法的收敛性和估计精度有何影响?
  • RQ4所提方法能否在联邦非凸稀疏学习中实现线性收敛和最优稀疏估计器的恢复?
  • RQ5在联邦IHT中,通信轮次与内部迭代次数之间的权衡如何影响整体训练效率?

主要发现

  • Fed-HT与FedIter-HT在非I.I.D.、去中心化数据条件下均实现与集中式IHT方法相似的线性收敛速率。
  • 在模拟实验I中,FedIter-HT相比分布式IHT将通信轮次减少最多达5倍(例如,20轮 vs. 100轮),且目标函数值相当或更优。
  • 在模拟实验II中,FedIter-HT仅用50轮即达到与分布式IHT在200轮内相同的目标函数值,通信轮次减少4倍。
  • 尽管内部迭代次数更多,但由于通信开销显著降低,Fed-HT与FedIter-HT在150 ms网络延迟和20 μs本地计算的假设下,整体速度至少快1.6倍。
  • 在基准数据集(E2006-tfidf、RCV1、MNIST)上,FedIter-HT在每轮通信中目标函数值减少方面持续优于其他方法,最终目标函数值最低。
  • 实证结果表明,在非I.I.D.数据下收敛路径的随机性增加,但FedIter-HT在所有数据集上均收敛至目标函数值最低的解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。