Skip to main content
QUICK REVIEW

[论文解读] Moniqua: Modulo Quantized Communication in Decentralized SGD

Yucheng Lu, Christopher De|arXiv (Cornell University)|Feb 26, 2020
Stochastic Gradient Optimization Techniques参考文献 49被引用 6
一句话总结

Moniqua 是一种通信高效、无内存开销的量化技术,用于去中心化随机梯度下降(SGD),通过模运算实现 1 位量化通信,且不损失收敛速度。它在无需额外内存的情况下,可证明维持与全精度去中心化 SGD 相同的渐近收敛率,同时支持任意量化器和非恒定步长。

ABSTRACT

Running Stochastic Gradient Descent (SGD) in a decentralized fashion has shown promising results. In this paper we propose Moniqua, a technique that allows decentralized SGD to use quantized communication. We prove in theory that Moniqua communicates a provably bounded number of bits per iteration, while converging at the same asymptotic rate as the original algorithm does with full-precision communication. Moniqua improves upon prior works in that it (1) requires zero additional memory, (2) works with 1-bit quantization, and (3) is applicable to a variety of decentralized algorithms. We demonstrate empirically that Moniqua converges faster with respect to wall clock time than other quantized decentralized algorithms. We also show that Moniqua is robust to very low bit-budgets, allowing 1-bit-per-parameter communication without compromising validation accuracy when training ResNet20 and ResNet110 on CIFAR10.

研究动机与目标

  • 为解决在去中心化 SGD 中应用量化通信的挑战,因为朴素量化会导致模型参数差异无法衰减,从而降低收敛性。
  • 设计一种方法,支持极端低比特量化(例如 1 位)且不增加内存使用。
  • 确保在使用有偏量化器和非恒定步长的情况下,收敛速度与全精度去中心化 SGD 的渐近速率保持一致。
  • 消除对误差追踪器或模型副本的需求,这些在先前方法中会引入高内存开销。
  • 在低带宽和高延迟等实际约束条件下,展示量化去中心化训练的鲁棒性与可扩展性。

提出的方法

  • Moniqua 利用模运算仅传输模型参数差异的模值,利用了在收敛附近差异减小的特性。
  • 它利用理论界:若 |x - y| < θ,则 x 可从 (x mod 2θ - y mod 2θ) mod 2θ + y 重构,从而减少比特需求。
  • 该方法通过混合时间 t_mix 和梯度范数界,动态维护对工作者间参数差异的上界 θ。
  • 该方法适用于多种去中心化算法,包括 D-PSGD、D² 和 AD-PSGD,在与全精度变体相同的条件下具有可证明的收敛性保证。
  • Moniqua 避免使用误差追踪或模型复制,因此额外内存开销为零。
  • 该算法使用量化器,通过模运算将值映射到有限集合,确保每次迭代的通信比特数有界。

实验结果

研究问题

  • RQ1能否在不降低收敛性的前提下,有效将量化通信应用于去中心化 SGD?
  • RQ2能否在去中心化训练中使用 1 位量化,同时保持收敛性和准确性?
  • RQ3能否在量化去中心化训练中实现与全精度相同的收敛速率,且内存开销为零?
  • RQ4与先前方法不同,该方法能否在非恒定步长和有偏量化器下正常工作?
  • RQ5Moniqua 在低带宽或高延迟网络条件下表现如何?

主要发现

  • 即使使用 1 位量化,Moniqua 仍能达到与全精度去中心化 SGD 相同的渐近收敛速率。
  • 实验结果表明,使用相同量化器时,Moniqua 在实际运行时间上比其他量化去中心化算法收敛更快。
  • Moniqua 在仅使用每参数 1 位的情况下,仍能保持在 CIFAR10 上使用 ResNet20 和 ResNet110 的验证准确率。
  • 该方法对极低比特预算具有鲁棒性,在 1 位精度下性能无下降。
  • 与先前使用误差追踪器或副本的方法不同,Moniqua 不需要额外内存,而这些方法的内存开销随模型大小和图结构增长。
  • 理论分析证实,Moniqua 的通信成本在每次迭代中均可证明有界,与模型大小或网络拓扑无关。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。