Skip to main content
QUICK REVIEW

[論文レビュー] Intermittent Pulling with Local Compensation for Communication-Efficient Federated Learning

Haozhao Wang, Zhihao Qu|arXiv (Cornell University)|Jan 22, 2020
Privacy-Preserving Technologies in Data参考文献 13被引用数 4
ひとこと要約

本稿では、通信効率の高いフェデレーテッドラーニング手法として、局所補正を伴うプルリダクション(PRLC)を提案する。PRLCでは、ワーカーが間歇的(間欠的)にグローバルモデルをプルし、同期のギャップを局所的更新で補正する。PRLCは、最先端手法LACと比較してプル操作を最大50%削減しながら、非削減手法と同等の収束速度を維持する。

ABSTRACT

Federated Learning is a powerful machine learning paradigm to cooperatively train a global model with highly distributed data. A major bottleneck on the performance of distributed Stochastic Gradient Descent (SGD) algorithm for large-scale Federated Learning is the communication overhead on pushing local gradients and pulling global model. In this paper, to reduce the communication complexity of Federated Learning, a novel approach named Pulling Reduction with Local Compensation (PRLC) is proposed. Specifically, each training node intermittently pulls the global model from the server in SGD iterations, resulting in that it is sometimes unsynchronized with the server. In such a case, it will use its local update to compensate the gap between the local model and the global model. Our rigorous theoretical analysis of PRLC achieves two important findings. First, we prove that the convergence rate of PRLC preserves the same order as the classical synchronous SGD for both strongly-convex and non-convex cases with good scalability due to the linear speedup with respect to the number of training nodes. Second, we show that PRLC admits lower pulling frequency than the existing pulling reduction method without local compensation. We also conduct extensive experiments on various machine learning models to validate our theoretical results. Experimental results show that our approach achieves a significant pulling reduction over the state-of-the-art methods, e.g., PRLC requiring only half of the pulling operations of LAG.

研究の動機と目的

  • 頻繁なモデルプルと勾配送信によって引き起こされるフェデレーテッドラーニングにおける高い通信オーバーヘッドを低減すること。
  • 収束速度やモデル精度を損なわずにプル操作の回数を削減すること。
  • 帯域が限られた大規模かつ分散型のフェデレーテッドラーニングシステムにおけるスケーラビリティと効率性を向上させること。
  • 間歇的同期の下でも収束保証を維持できる理論的根拠を持つ手法を開発すること。

提案手法

  • 各SGDイテレーションにおいて、ワーカーはサーバーからグローバルモデルをプルするかどうかをランダムに決定し、間歇的同期を実現する。
  • プルを行わない間は、ワーカーが自身の局所的モデル更新を用いてグローバル更新を近似し、モデルギャップを補正する。
  • 局所的更新は、すべてのワーカーにおける平均更新の代理として機能し、頻繁なサーバーへのプルに依存しなくなる。
  • 理論的分析により、PRLCの収束速度が、強い凸および非凸設定の両方で古典的同期SGDと同等であることが証明されている。
  • プル頻度を制御するプル比 $ r $ が導入され、実験では通信コストと収束のバランスを考慮して $ r = 0.4 $ を使用した。
  • 非IIDデータおよび低帯域のエッジ環境下でも安定した性能を示すように設計されており、実際のクラスタシミュレーションにより検証された。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドラーニングにおいて、間歇的プルに局所補正を組み合わせることで、同期SGDと同等の収束速度を維持できるか?
  • RQ2補正なしのプル削減手法と比較して、局所補正が性能にどのように寄与するか?
  • RQ3収束性とモデル精度を保証するための最小プル頻度(すなわちプル比)はどの程度か?
  • RQ4収束時間と通信効率の観点から、PRLCはASGD や LAG と比較してどのように優れているか?
  • RQ5PRLCはトレーニングノード数に比例して線形にスケーリングするか?また、非IIDデータ分布下でも性能を維持できるか?

主な発見

  • PRLCは、LACと比較してプル操作を50%削減し、ロジスティック回帰およびResNet18モデルの両方で収束に至るまでのプル回数を半分にした。
  • PRLCの収束速度は、強い凸および非凸の両目的関数において、古典的同期SGDと同程度のオーダーである。
  • PRLCはASGDよりも優れたスケーラビリティを示し、トレーニングノード数の増加に伴い収束時間に線形スケーリングが見られた。
  • 実験では、低帯域のエッジ環境下でPRLCがASGDよりも約30%速く収束し、収束時間はそれぞれ約100,000秒と約140,000秒であった。
  • 局所補正は性能向上に顕著な寄与を示した。PRLCは補正なしのベースライン手法(PR)を上回り、特に初期学習段階で収束損失ギャップが小さくなった。
  • PRLCの収束ギャップは学習率の減少に伴い2乗的に減少し、2次収束改善の理論的予測を裏付ける結果となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。