Skip to main content
QUICK REVIEW

[論文レビュー] Communication-Efficient Decentralized Learning with Sparsification and Adaptive Peer Selection

Zhenheng Tang, Shaohuai Shi|ArXiv.org|Feb 22, 2020
Stochastic Gradient Optimization Techniques参考文献 27被引用数 11
ひとこと要約

本稿では、モデルのスパarsificationと適応的ピア選択を組み合わせることで通信効率を向上させる分散学習アルゴリズムSAPS-PSGDを提案する。各ワーカーが通信する相手を動的に1名に限定し、高度に圧縮されたモデルを交換することで、従来手法と比較して最大99.5%の通信量削減を達成し、収束時間も顕著に短縮される。理論的収束保証も与えられている。

ABSTRACT

Distributed learning techniques such as federated learning have enabled multiple workers to train machine learning models together to reduce the overall training time. However, current distributed training algorithms (centralized or decentralized) suffer from the communication bottleneck on multiple low-bandwidth workers (also on the server under the centralized architecture). Although decentralized algorithms generally have lower communication complexity than the centralized counterpart, they still suffer from the communication bottleneck for workers with low network bandwidth. To deal with the communication problem while being able to preserve the convergence performance, we introduce a novel decentralized training algorithm with the following key features: 1) It does not require a parameter server to maintain the model during training, which avoids the communication pressure on any single peer. 2) Each worker only needs to communicate with a single peer at each communication round with a highly compressed model, which can significantly reduce the communication traffic on the worker. We theoretically prove that our sparsification algorithm still preserves convergence properties. 3) Each worker dynamically selects its peer at different communication rounds to better utilize the bandwidth resources. We conduct experiments with convolutional neural networks on 32 workers to verify the effectiveness of our proposed algorithm compared to seven existing methods. Experimental results show that our algorithm significantly reduces the communication traffic and generally select relatively high bandwidth peers.

研究の動機と目的

  • 分散型およびフェデレーテッドラーニングにおける通信ボトルネック、特に低帯域幅のワーカーを対象に解決すること。
  • 中央パラメータサーバーの必要性を排除し、単一障害点となる通信ボトルネックを回避すること。
  • モデルのスパarsificationと単一ピア通信により、ワーカーごとの通信オーバーヘッドを低減すること。
  • 各通信ラウンドで高帯域幅を持つピアを動的に選択することで、帯域幅の利用効率を向上させること。
  • 通信量を大幅に削減しながらも、収束性能を維持すること。

提案手法

  • アルゴリズムはTop-kスパarsificationを用い、最大の絶対値を持つパラメータのみを保持し、勾配の99~99.9%をゼロにすることでモデル更新を圧縮する。
  • 各ワーカーは1ラウンドあたり1人のピアとのみ通信するため、1ワーカーあたりの通信複雑度がO(1)に低減される。
  • 適応的ピア選択により、各ラウンドで利用可能な最高帯域幅を持つピアを動的に選定し、通信効率を最適化する。
  • 中央パラメータサーバーを一切使用しない完全分散型の動作を実現し、障害耐性とスケーラビリティを確保する。
  • 理論的分析により、標準的な仮定の下で収束が保証され、収束速度は標準的なPSGDと同等であることを示す。
  • スパarsificationによる精度損失を補償するため、誤差補償が適用されている。

実験結果

リサーチクエスチョン

  • RQ1分散型学習アルゴリズムは、収束速度を損なわずに顕著な通信量削減を達成できるか?
  • RQ2異種の帯域幅環境下で、適応的ピア選択は通信効率にどのように影響を与えるか?
  • RQ3スパarsificationと単一ピア通信を組み合わせた手法は、分散学習における収束保証を維持できるか?
  • RQ4通信トラフィックと通信時間の観点から、提案手法は中央集権型および分散型のベースラインと比べてどのように差をつけるか?
  • RQ5帯域幅の非均一性は、適応的ピア選択を用いた分散学習の性能にどのような影響を与えるか?

主な発見

  • SAPS-PSGDは、PSGD や FedAvg といったベースライン手法と比較して、通信トラフィックを最大99.5%削減し、MNIST-CNNではたった10 MBのトラフィックにまで抑える。
  • CIFAR10-CNNでは、SAPS-PSGDの通信時間は75秒で、S-FedAvg(680秒)やDCD-PSGD(144,000秒)を大きく上回る性能を示す。
  • アルゴリズムは一貫して高帯域幅のピアを選択し、非均一ネットワーク環境下でも帯域幅の利用効率を高め、通信時間を短縮する。
  • SAPS-PSGDは、標準的なPSGDと同等の収束性能を維持しており、収束速度に関する理論的保証も与えられている。
  • 32ワーカーを用いた実験では、SAPS-PSGDはResNet-20で50秒で目標精度に到達し、D-PSGD(118,000秒)を著しく上回る。
  • ResNet-20では、DCD-PSGDと比較して通信時間を最大99.6%削減し、低帯域幅環境下でも強力なスケーラビリティを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。