Skip to main content
QUICK REVIEW

[论文解读] Federated Progressive Sparsification (Purge, Merge, Tune)+

Dimitris Stripelis, Umang Gupta|arXiv (Cornell University)|Apr 26, 2022
Privacy-Preserving Technologies in Data被引用 4
一句话总结

FedSparsify 是一种简单、迭代的联邦剪枝方法,在训练过程中逐步移除神经网络中的低 magnitude 权重,可在保持或提升准确率的前提下,实现 15 倍的模型尺寸缩减、4 倍的推理速度提升以及 3 倍的通信成本降低,适用于多种联邦学习场景。

ABSTRACT

To improve federated training of neural networks, we develop FedSparsify, a sparsification strategy based on progressive weight magnitude pruning. Our method has several benefits. First, since the size of the network becomes increasingly smaller, computation and communication costs during training are reduced. Second, the models are incrementally constrained to a smaller set of parameters, which facilitates alignment/merging of the local models and improved learning performance at high sparsification rates. Third, the final sparsified model is significantly smaller, which improves inference efficiency and optimizes operations latency during encrypted communication. We show experimentally that FedSparsify learns a subnetwork of both high sparsity and learning performance. Our sparse models can reach a tenth of the size of the original model with the same or better accuracy compared to existing pruning and nonpruning baselines.

研究动机与目标

  • 开发一种实用的、迭代的联邦学习剪枝策略,以在不损失准确率的前提下减少模型尺寸和通信成本。
  • 解决在计算和内存资源有限的去中心化、非独立同分布(non-IID)数据环境中训练极稀疏神经网络的挑战。
  • 为未来联邦模型稀疏化研究提供一个强大且简单的基线方法。
  • 评估渐进式剪枝对联邦设置中收敛性和性能的影响。
  • 证明迭代的基于幅度的剪枝在极端稀疏性环境下优于一次性剪枝和动态剪枝方法。

提出的方法

  • FedSparsify 在每个联邦训练轮次结束时应用迭代的、基于幅度的非结构化剪枝,移除最低幅度的权重。
  • 该方法以渐进方式交替执行剪枝、聚合(在服务器上合并客户端模型)和微调(在本地数据上重新训练)。
  • 通过全局模型聚合策略在客户端之间全局应用剪枝,确保网络中稀疏性的一致性。
  • 该过程在多个联邦轮次中重复进行,逐步提高稀疏度,同时通过微调保持模型性能。
  • 稀疏度通过目标剪枝比例进行控制,模型被剪枝至原始大小的 10% 或以下。
  • 该方法使用标准的联邦平均(FedAvg)进行模型聚合,并通过微调恢复剪枝后的性能。

实验结果

研究问题

  • RQ1在联邦学习中,迭代的、基于幅度的剪枝能否在保持模型准确率的前提下实现高稀疏度(例如 99%)?
  • RQ2与一次性剪枝或动态剪枝相比,渐进式剪枝在通信效率和推理速度方面表现如何?
  • RQ3渐进式剪枝的正则化效应是否能提升非独立同分布(non-IID)联邦设置下的泛化能力?
  • RQ4FedSparsify 是否能在模型效率和通信成本方面优于非剪枝基线方法(如 FedAvg)?
  • RQ5在极端稀疏度下,全局剪枝与本地剪枝策略对性能的影响如何?

主要发现

  • FedSparsify 实现了平均 15 倍的模型尺寸缩减,稀疏模型在 99% 稀疏度下相比密集模型仅损失 7–9% 的准确率。
  • 该方法使推理吞吐量提升 4 倍,CNN 和 VGG 模型在 99% 稀疏度下分别实现 4 倍和 8 倍的加速。
  • 与非剪枝基线相比,通信成本降低了 3 倍,原因是每轮交换的参数更少。
  • 在 100 个客户端且数据为非独立同分布(non-IID)的场景下,FedSparsify-Global 的表现优于 FedSparsify-Local,甚至优于密集基线如 FedAvg 和 FedProx。
  • 一次性剪枝配合微调在 99% 稀疏度下无法实现泛化,而 FedSparsify 通过渐进式剪枝保持了性能。
  • 渐进式剪枝的正则化效应增强了模型泛化能力,尤其在数据稀缺的非独立同分布环境中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。