[论文解读] Sparse Random Networks for Communication-Efficient Federated Learning
该论文提出FedPM,一种通信高效的联邦学习框架,通过训练一个随机初始化的密集神经网络的随机二值掩码来稀疏化模型,从而消除传输模型权重的需求。通过协作学习最优子网络,FedPM实现低于1 bpp的通信成本,具备更快的收敛速度、更高的准确率和模型压缩能力,在低比特率环境下于MNIST、EMNIST、CIFAR-10和CIFAR-100数据集上优于基线方法。
One main challenge in federated learning is the large communication cost of exchanging weight updates from clients to the server at each round. While prior work has made great progress in compressing the weight updates through gradient compression methods, we propose a radically different approach that does not update the weights at all. Instead, our method freezes the weights at their initial \emph{random} values and learns how to sparsify the random network for the best performance. To this end, the clients collaborate in training a \emph{stochastic} binary mask to find the optimal sparse random network within the original one. At the end of the training, the final model is a sparse network with random weights -- or a subnetwork inside the dense random network. We show improvements in accuracy, communication (less than $1$ bit per parameter (bpp)), convergence speed, and final model size (less than $1$ bpp) over relevant baselines on MNIST, EMNIST, CIFAR-10, and CIFAR-100 datasets, in the low bitrate regime under various system configurations.
研究动机与目标
- 为解决联邦学习中的高通信成本,特别是在低比特率和非独立同分布(non-IID)数据设置下的问题。
- 通过冻结初始随机权重并仅学习稀疏二值掩码,消除传输完整模型权重的需求。
- 在通信开销低于每参数1比特的前提下,提升收敛速度和最终模型准确率。
- 通过稀疏、低比特率的子网络实现模型压缩和潜在的隐私增益。
- 开发一种稳健的概率聚合策略,以应对部分客户端参与和数据异质性问题。
提出的方法
- 客户端在随机初始化的密集神经网络上协作训练一个随机二值掩码,且不更新网络权重。
- 使用带有Beta先验的贝叶斯概率框架训练掩码,实现在多轮通信中对不确定性的感知聚合。
- 通过可微分的随机采样过程更新全局掩码参数,即使在二值掩码下仍能保持梯度流动。
- 将掩码应用于固定随机网络,形成稀疏子网络,并在每轮中评估其性能。
- 通过重置频率超参数控制先验刷新的频率,平衡模型稳定性与对新客户端更新的响应能力。
- 通过仅传输二值掩码及其概率参数,将通信成本降低至每参数低于1比特(bpp)。
实验结果
研究问题
- RQ1是否可以在不更新权重的情况下,在随机初始化的密集网络中学习到一个子网络,从而显著降低通信成本?
- RQ2与确定性或硬阈值方法相比,随机概率掩码训练策略在准确率和收敛性方面表现如何?
- RQ3在非独立同分布数据和部分客户端参与的情况下,带有自适应先验重置的贝叶斯聚合策略是否能提升性能?
- RQ4所提出方法在多大程度上降低了通信比特率,同时保持或提升模型准确率?
- RQ5最终模型是否既能实现压缩(低于1 bpp),又在低比特率联邦学习中比基线更准确?
主要发现
- FedPM实现每参数通信成本低于1比特(bpp),显著降低带宽需求。
- 该方法在MNIST、EMNIST、CIFAR-10和CIFAR-100数据集上收敛更快,且测试准确率高于基线方法,包括FedMask。
- 在非独立同分布设置下,部分客户端参与时,FedPM优于确定性基线,尤其在数据异质性较高时(如c_max = 4)表现更优。
- 带有自适应先验重置(γ ≈ 1/ρ)的贝叶斯聚合策略相比固定或过频重置,能带来更好的收敛性和准确率。
- 最终模型为稀疏子网络,大小低于1 bpp,实现模型压缩并具备潜在隐私优势。
- 消融实验表明,随机掩码训练方法至关重要,而确定性或非概率变体无法收敛或性能较差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。