[论文解读] Wyner-Ziv Gradient Compression for Federated Learning
本文提出了一种用于联邦学习的新型梯度压缩方法——局部量化随机梯度下降(LQSGD),该方法利用历史梯度作为辅助信息以减少通信开销。通过在不依赖概率假设的前提下应用Wyner-Ziv编码原理,LQSGD在仅损失0.08%准确率的情况下,于CIFAR-10上实现了优于QSGD的收敛性能,并在CIFAR-100上实现了接近SGD的性能,且采用3比特量化。
Due to limited communication resources at the client and a massive number of model parameters, large-scale distributed learning tasks suffer from communication bottleneck. Gradient compression is an effective method to reduce communication load by transmitting compressed gradients. Motivated by the fact that in the scenario of stochastic gradients descent, gradients between adjacent rounds may have a high correlation since they wish to learn the same model, this paper proposes a practical gradient compression scheme for federated learning, which uses historical gradients to compress gradients and is based on Wyner-Ziv coding but without any probabilistic assumption. We also implement our gradient quantization method on the real dataset, and the performance of our method is better than the previous schemes.
研究动机与目标
- 为解决由于高维模型参数导致的大规模联邦学习中的通信瓶颈问题。
- 利用联邦训练中相邻随机梯度之间的高相关性,以提升压缩效率。
- 开发一种实用的梯度压缩方案,利用历史梯度作为辅助信息,且无需依赖概率假设。
- 在真实数据集上实证验证所提方法,并与现有方案(如QSGD)进行性能比较。
- 在标准假设下,建立梯度量化误差和收敛速率的理论边界。
提出的方法
- 提出局部量化随机梯度下降(LQSGD),一种在客户端侧利用历史梯度作为辅助信息的梯度压缩方案。
- 将Wyner-Ziv编码原理适配于梯度压缩,实现在无需对数据分布做概率假设的前提下高效实现有损压缩。
- 采用一种量化策略,基于当前梯度与历史梯度之间的差异来估计当前梯度,从而最小化重建误差。
- 通过添加均值为零的噪声,引入无偏梯度估计器,以保持优化过程中的收敛特性。
- 在实际应用中,由于计算2-范数在大型模型(如ResNet18)中不可行,改用梯度的无穷范数。
- 在包括cpusmall-scale、CIFAR-10和CIFAR-100在内的真实数据集上实现该方案,使用8个客户端评估性能。
实验结果
研究问题
- RQ1在联邦学习中,历史梯度能否被有效用作辅助信息以提升梯度压缩效率?
- RQ2在通信比特受限条件下,所提出的LQSGD方法与QSGD相比,在收敛速度和模型准确率方面表现如何?
- RQ3所提出的压缩方案在量化误差和收敛速率方面能提供哪些理论保证?
- RQ4使用辅助信息是否能导致平均平方梯度的上界小于无辅助信息的方法?
- RQ5该方法在极端量化(如每参数2–3比特)下是否仍能保持高模型准确率?
主要发现
- 在cpusmall-scale数据集上采用2比特量化时,LQSGD在1200次迭代内收敛,优于QSGD(1700次迭代),并达到与GD相当的性能。
- 在同一数据集上,LQSGD与最优模型参数之间的欧氏距离低于QSGD,表明其具有更好的优化稳定性。
- 在CIFAR-10上采用3比特量化时,LQSGD实现了94.53%的测试准确率,仅比全精度SGD(94.61%)低0.08%,而QSGD则损失了0.42%。
- 在CIFAR-100上,LQSGD实现了76.45%的测试准确率,与SGD(76.44%)相当,并显著优于QSGD(76.03%)。
- 在约70个训练周期后,LQSGD在CIFAR-10和CIFAR-100上的测试准确率均超过QSGD,表明其具有更优的长期优化性能。
- 理论分析表明,利用历史梯度可降低平均平方梯度的上界,并在标准假设下建立收敛速率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。