Skip to main content
QUICK REVIEW

[論文レビュー] A Distributed Synchronous SGD Algorithm with Global Top-$k$ Sparsification for Low Bandwidth Networks

Shaohuai Shi, Qiang Wang|arXiv (Cornell University)|Jan 14, 2019
Stochastic Gradient Optimization Techniques参考文献 35被引用数 9
ひとこと要約

本稿では、低帯域幅ネットワークにおける通信オーバーヘッドを低減するため、グローバルなトップ-k勾配スパース化を用いた分散同期SGDアルゴリズム、gTop-k S-SGDを提案する。各ワーカーのローカルなトップ-k勾配を集約するのではなく、すべてのワーカーにわたる最大絶対値を持つ勾配からトップ-kを選択することで、通信複雑度をO(kP)からO(k log P)に低減し、密行列SGDよりも2.7–12倍高いスケーリング効率を達成するとともに、既存のTop-k S-SGDよりも1.1–1.7倍優れた性能を示した。32-GPU 1Gbps Ethernetクラスタ上で評価した結果、性能が向上した。

ABSTRACT

Distributed synchronous stochastic gradient descent (S-SGD) has been widely used in training large-scale deep neural networks (DNNs), but it typically requires very high communication bandwidth between computational workers (e.g., GPUs) to exchange gradients iteratively. Recently, Top-$k$ sparsification techniques have been proposed to reduce the volume of data to be exchanged among workers. Top-$k$ sparsification can zero-out a significant portion of gradients without impacting the model convergence. However, the sparse gradients should be transferred with their irregular indices, which makes the sparse gradients aggregation difficult. Current methods that use AllGather to accumulate the sparse gradients have a communication complexity of $O(kP)$, where $P$ is the number of workers, which is inefficient on low bandwidth networks with a large number of workers. We observe that not all top-$k$ gradients from $P$ workers are needed for the model update, and therefore we propose a novel global Top-$k$ (gTop-$k$) sparsification mechanism to address the problem. Specifically, we choose global top-$k$ largest absolute values of gradients from $P$ workers, instead of accumulating all local top-$k$ gradients to update the model in each iteration. The gradient aggregation method based on gTop-$k$ sparsification reduces the communication complexity from $O(kP)$ to $O(k\log P)$. Through extensive experiments on different DNNs, we verify that gTop-$k$ S-SGD has nearly consistent convergence performance with S-SGD, and it has only slight degradations on generalization performance. In terms of scaling efficiency, we evaluate gTop-$k$ on a cluster with 32 GPU machines which are interconnected with 1 Gbps Ethernet. The experimental results show that our method achieves $2.7-12 imes$ higher scaling efficiency than S-SGD and $1.1-1.7 imes$ improvement than the existing Top-$k$ S-SGD.

研究の動機と目的

  • 低帯域幅ネットワークにおける分散同期SGD(S-SGD)の高い通信オーバーヘッドを軽減すること。特に、ワーカー数が多い場合に有効であることを目的とする。
  • 不規則な勾配インデックスにより、O(kP)の複雑度を要するAllGatherを必要とする既存のTop-kスパース化手法の非効率性を克服すること。
  • 大規模なDNN学習におけるモデルの収束性および汎化性能を維持しつつ、通信複雑度を低減すること。
  • コンsumerクラスの1Gbps Ethernetクラスタ上で、冗長な勾配転送を最小限に抑えることで、スケーリング効率を向上させること。

提案手法

  • 各ワーカーの勾配全体から絶対値が最大のk個の勾配を選択するグローバルなトップ-k(gTop-k)スパース化メカニズムを提案する。ローカルなトップ-k勾配を集約するのではなく、グローバルなトップ-k勾配を選択することで、通信の複雑度を低減する。
  • 通信効率の高い集合的演算として、gTopKAllReduceアルゴリズムを導入。このアルゴリズムにより、勾配集約の複雑度をO(kP)からO(k log P)に低減する。
  • O(log P)ラウンドで実行されるトーナメントベースのアプローチを用いて、Pワーカーにわたるグローバルなトップ-k勾配を特定する分散選択プロトコルを設計する。
  • スパースなインデックスの通信を最小限に抑えるために、選択されたグローバルなトップ-k値にのみ勾配インデックス情報を保持する。
  • 収束性と精度を維持するため、モーメンタム補正と勾配クリッピングを組み合わせたgTop-kスパース化をS-SGDフレームワークに統合する。
  • 学習ループへの変更を最小限に抑えることで、既存のディープラーニングフレームワークとの互換性を確保する。

実験結果

リサーチクエスチョン

  • RQ1グローバルなトップ-k勾配選択は、モデル収束性に悪影響を及げることなく、分散S-SGDにおける通信複雑度を低減できるか?
  • RQ2gTopKAllReduceの通信複雑度は、AllGatherベースのTop-k集約(TopKAllReduce)と比較して、ワーカー数の増加に伴いどのようにスケーリングするか?
  • RQ3gTop-kスパース化は、密行列SGDおよびローカルTop-k S-SGDと比較して、モデルの精度および収束速度にどのような影響を及えるか?
  • RQ4大規模なワーカー数を有する低帯域幅ネットワークにおいて、gTop-k S-SGDのスケーリング効率はどのように評価されるか?
  • RQ5gTop-k S-SGDは、ResNet、VGG、RNNsといった多様なDNNアーキテクチャにおいて、帯域制限下でも高い学習効率を維持できるか?

主な発見

  • gTop-k S-SGDは、通信複雑度をO(kP)からO(k log P)に低減し、大規模クラスタにおけるスケーラビリティを顕著に向上させた。
  • 1Gbps Ethernetで接続された32-GPUクラスタ上では、gTop-k S-SGDは密行列SGDと比較して2.7–12倍高いスケーリング効率を達成した。
  • 同じハードウェア環境下で、既存のTop-k S-SGD手法と比較して、gTop-k S-SGDは1.1–1.7倍のスケーリング効率向上を示した。
  • gTop-k S-SGDのモデル収束性はS-SGDとほぼ同一であり、汎化性能にわずかな劣化が生じるにとどまった。
  • ResNet-20では、ミニバッチサイズが1024の場合、Top-k S-SGDと比較して約9%の精度低下を示したが、より小さなミニバッチサイズではこの値は約0.5%に低下した。
  • VGG-16では、gTop-k S-SGDはTop-k S-SGDと比較してわずか約1%の精度低下を示し、大きなミニバッチサイズでは約6%の低下を示した。これは、バッチサイズの変化に対してより高いロバストネスを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。