Skip to main content
QUICK REVIEW

[論文レビュー] On the Utility of Gradient Compression in Distributed Training Systems

Saurabh Agarwal, Hongyi Wang|arXiv (Cornell University)|Feb 28, 2021
Stochastic Gradient Optimization Techniques参考文献 94被引用数 19
ひとこと要約

この論文は分散学習における勾配圧縮の評価を行い、計算と通信のオーバーラップといった顕著なシステム最適化が施されていても、200以上の設定のうちわずか6つしか最適化された同期的SGDよりも高速化を達成していないことが判明した。主な洞察は、圧縮手法における高いエンコード・デコードのオーバーヘッドが、特に高帯域幅環境下でその利点を制限しており、将来的な性能向上はより高速な計算能力または圧縮の遅延低減に依存するということである。

ABSTRACT

A rich body of prior work has highlighted the existence of communication bottlenecks in synchronous data-parallel training. To alleviate these bottlenecks, a long line of recent work proposes gradient and model compression methods. In this work, we evaluate the efficacy of gradient compression methods and compare their scalability with optimized implementations of synchronous data-parallel SGD across more than 200 different setups. Surprisingly, we observe that only in 6 cases out of more than 200, gradient compression methods provide speedup over optimized synchronous data-parallel training in the typical data-center setting. We conduct an extensive investigation to identify the root causes of this phenomenon, and offer a performance model that can be used to identify the benefits of gradient compression for a variety of system setups. Based on our analysis, we propose a list of desirable properties that gradient compression methods should satisfy, in order for them to provide a meaningful end-to-end speedup.

研究の動機と目的

  • 勾配圧縮が現代の分散学習システムにおいて実用的であるかを評価すること。
  • 計算と通信のオーバーラップを実装した最適化された同期的SGDと比較して、勾配圧縮手法の性能を評価すること。
  • 理論的には通信量の削減が見込めるにもかかわらず、勾配圧縮がしばしば高速化をもたらさない理由を特定すること。
  • エンドツーエンドの高速化をもたらすかどうかを予測できる性能モデルを構築すること。
  • 将来の勾配圧縮手法が有意のスケーラビリティを達成するための望ましい特性を定義すること。

提案手法

  • ResNet-50、ResNet-101、BERTを用いて、200以上の設定で3つの勾配圧縮手法(sign SGD、MSTop-K、PowerSGD)を実験的に評価した。
  • PyTorch v1.8の通信フックインタフェースを活用し、バックワードパスの計算と勾配圧縮をオーバーラップ可能とした。
  • バッチサイズ、ネットワーク帯域幅(1–30 Gbps)、GPU数(最大96)を変化させた上で、エンドツーエンドのイテレーション時間を測定した。
  • 計算、通信、エンコード・デコードのオーバーヘッドを考慮した解析的性能モデルを構築し、圧縮の有効性を予測した。
  • 計算能力が4倍速くなった場合や、圧縮レートを変化させた際のエンコード・デコード時間の短縮効果をシミュレーションした。
  • 効率的なアラールーブ通信のためNCCLを用い、PyTorch DDPのネイティブ最適化版と比較した。

実験結果

リサーチクエスチョン

  • RQ1どのようなシステム的条件下で、勾配圧縮が最適化された同期的SGDを上回るエンドツーエンドの高速化を達成できるか?
  • RQ2既存の勾配圧縮手法は、通信量の削減を実現しているにもかかわらず、なぜ高速化をもたらさないのか?
  • RQ3計算と通信のオーバーラップといったシステムレベルの最適化は、勾配圧縮の実用性にどのように影響するか?
  • RQ4ネットワーク帯域幅と計算速度は、勾配圧縮の有効性にどのような影響を及けるか?
  • RQ5圧縮レートとエンコード・デコード時間の間で、性能に最も寄与するトレードオフは何か?

主な発見

  • 通常のデータセンターバンドル幅下で、200以上の実験的設定のうちわずか6つしか、最適化された同期的SGDを上回る高速化を達成できなかった。
  • 圧縮手法のエンコード・デコード時間(例:50 ms以上)が、通信を隠ぺいできる時間枠を上回っており、高速化の可能性が制限されている。
  • PowerSGDは、アラールーブに対応しているため、sign SGD よりもスケーラビリティに優れている。一方、sign SGD はアラールーブ非対応のため、遅延が高くなる。
  • ネットワーク帯域幅が9 Gbpsを超えると、PowerSGD は同期的SGDよりも遅くなる。これは固定のエンコード・デコードオーバーヘッドに起因する。
  • 計算能力が4倍速くなった場合、Rank-4のPowerSGDは最大1.75倍の高速化を達成でき、将来的なハードウェアの進歩が圧縮の利点を解き放つ可能性を示している。
  • 圧縮レートを犠牲にしても、エンコード・デコード時間を短縮することは性能を著しく向上させる。これは、圧縮レートよりも遅延低減が性能向上により重要であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。