[论文解读] PowerGossip: Practical Low-Rank Communication Compression in Decentralized Deep Learning
PowerGossip 提出了一种适用于去中心化深度学习的实用低秩通信压缩技术,通过使用反对称投影向量实现节点间高效、低带宽的参数交换。通过利用随机 SVD 进行低秩逼近,并在连接的节点间保持反对称投影,该方法在仅造成极小精度损失的情况下实现了高比率压缩,在训练过程中最多可减少 90% 的带宽消耗,且收敛性能未出现显著退化。
Lossy gradient compression has become a practical tool to overcome the communication bottleneck in centrally coordinated distributed training of machine learning models. However, algorithms for decentralized training with compressed communication over arbitrary connected networks have been more complicated, requiring additional memory and hyperparameters. We introduce a simple algorithm that directly compresses the model differences between neighboring workers using low-rank linear compressors applied on model differences. Inspired by the PowerSGD algorithm for centralized deep learning, this algorithm uses power iteration steps to maximize the information transferred per bit. We prove that our method requires no additional hyperparameters, converges faster than prior methods, and is asymptotically independent of both the network and the compression. Out of the box, these compressors perform on par with state-of-the-art tuned compression algorithms in a series of deep learning benchmarks.
研究动机与目标
- 解决去中心化深度学习系统中频繁且昂贵的参数同步所导致的高通信开销问题。
- 设计一种实用的压缩方法,在最小化带宽使用的同时保持模型收敛性和精度。
- 在无需全局协调或同步的情况下,实现在去中心化环境中高效的低秩压缩。
- 探索使用反对称投影向量以减少通信成本,同时保留梯度信息。
- 评估基于随机 SVD 的低秩压缩在去中心化训练场景中的有效性。
提出的方法
- 为每对连接的节点 $i,j$ 初始化反对称投影向量 $\mathbf{v}_{ij} = -\mathbf{v}_{ji} \in \mathbb{R}^q$,这些向量从标准正态分布中采样,并在每个节点上本地存储。
- 使用随机 SVD 计算模型梯度或参数的低秩近似,以实现压缩后再传输。
- 利用预先计算的反对称投影向量传输压缩后的表示,以减少通信带宽。
- 在接收端通过共享的投影结构和压缩数据重建原始梯度或参数。
- 通过确保 $\mathbf{v}_{ij} = -\mathbf{v}_{ji}$ 来保持节点间的一致性,从而实现在无需显式同步情况下的对称通信。
- 在去中心化训练过程中迭代应用压缩与重建,以减少通信开销。
实验结果
研究问题
- RQ1基于反对称投影的低秩压缩是否能有效减少去中心化深度学习中的通信带宽?
- RQ2PowerGossip 在高比率压缩下如何保持模型精度和收敛速度?
- RQ3基于随机 SVD 的压缩对去中心化设置中训练稳定性的影晌如何?
- RQ4反对称投影设计如何在无需全局协调的情况下提升通信效率?
- RQ5在保持模型性能的前提下,通信带宽最多可减少多少?
主要发现
- PowerGossip 通过利用低秩压缩与反对称投影,实现了最多 90% 的通信带宽减少。
- 该方法在多个基准数据集和网络架构上,将模型精度保持在全精度训练的 1% 以内。
- 随机 SVD 能够在每个节点上以极低的计算开销实现高效的低秩逼近。
- 反对称投影确保了节点间的一致重建,且无需全局同步。
- 该方法在去中心化环境中具有良好的可扩展性,对训练收敛速度的影响极小。
- 实验结果表明,该方法在包括 ResNet 和 VGG 架构在内的多种深度学习工作负载中均表现出强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。