Skip to main content
QUICK REVIEW

[論文レビュー] Bidirectional compression in heterogeneous settings for distributed or federated learning with partial participation: tight convergence guarantees

Constantin Philippenko, Aymeric Dieuleveut|arXiv (Cornell University)|Jun 25, 2020
Stochastic Gradient Optimization Techniques参考文献 28被引用数 8
ひとこと要約

本稿では、弱い仮定のもとで収束保証を維持しながら、上行リンクおよび下行リンクの通信を両方圧縮する分散学習およびフェデレーテッドラーニング向けの双方向圧縮フレームワーク、Artemis を紹介する。非独立同分布(non-i.i.d.)設定下で部分的なワーカー参加を伴う状況において、ノイズ閾値まで線形収束を達成し、圧縮誤差を低減するメモリ機構を活用することで、圧縮に起因する漸近的分散の下界を提示する。

ABSTRACT

We introduce a framework - Artemis - to tackle the problem of learning in a distributed or federated setting with communication constraints and device partial participation. Several workers (randomly sampled) perform the optimization process using a central server to aggregate their computations. To alleviate the communication cost, Artemis allows to compress the information sent in both directions (from the workers to the server and conversely) combined with a memory mechanism. It improves on existing algorithms that only consider unidirectional compression (to the server), or use very strong assumptions on the compression operator, and often do not take into account devices partial participation. We provide fast rates of convergence (linear up to a threshold) under weak assumptions on the stochastic gradients (noise's variance bounded only at optimal point) in non-i.i.d. setting, highlight the impact of memory for unidirectional and bidirectional compression, analyze Polyak-Ruppert averaging. We use convergence in distribution to obtain a lower bound of the asymptotic variance that highlights practical limits of compression. We propose two approaches to tackle the challenging case of devices partial participation and provide experimental results to demonstrate the validity of our analysis.

研究の動機と目的

  • 分散学習およびフェデレーテッドラーニングにおける通信ボトルネックを解消するため、上行リンクおよび下行リンクのメッセージを両方圧縮すること。
  • 従来の手法が上行リンクのみを圧縮するか、圧縮演算子に関する強い仮定に依存するという限界を克服すること。
  • 部分的なワーカー参加という現実的で一般的な課題を伴う非独立同分布(non-i.i.d.)設定下でも収束保証を提供すること。
  • 単方向および双方向圧縮設定における収束に与えるメモリ機構の影響を分析すること。
  • 圧縮に起因する漸近的分散の下界を確立し、通信効率の実用的限界を明らかにすること。

提案手法

  • 相対誤差が有界である圧縮演算子を用いて、ワーカーからサーバーへの上行リンクおよびサーバーからワーカーへの下行リンクの両方向に圧縮を適用するフレームワーク Artemis を提案する。
  • 圧縮誤差を追跡・補正するためのメモリ機構を導入し、収束の安定性を向上させる。
  • 分布収束を用いて反復値の漸近的分散の下界を導出し、圧縮の根本的限界を定量化する。
  • Polyak-Ruppert平均化を用いることで収束速度を向上させ、最終解の分散を低減する。
  • 弱い仮定のもとでの収束解析を定式化する:最適点における確率的勾配の分散のみが有界であると仮定する。
  • 部分的なワーカー参加に対応する2つのアプローチを提示し、現実の学習シナリオにおける耐障害性を確保する。

実験結果

リサーチクエスチョン

  • RQ1部分的参加を伴う非独立同分布(non-i.i.d.)フェデレーテッドラーニング設定下で、メモリ機構を備えた双方向圧縮が線形収束を達成できるか。
  • RQ2圧縮演算子の選択(単方向対比・双方向)が収束速度および最終解の品質に与える影響は何か。
  • RQ3漸近的分散の観点から、圧縮の根本的限界は何か。また、データの非独立性にどのように依存するか。
  • RQ4メモリ機構は、上行リンクおよび下行リンク通信における圧縮誤差の影響をどのように低減するか。
  • RQ5部分的参加が収束に与える実用的影響は何か。また、それらはどのように緩和できるか。

主な発見

  • Artemis は、弱い仮定のもとで、具体的には最適点における勾配の分散が有界であるという条件下で、ノイズ閾値まで線形収束を達成する。
  • 反復値の漸近的分散は、$(1 + \rho_{\text{up}})(1 + \rho_{\text{dwn}})\frac{\rho_*^2}{b}$ に比例する項によって下界づけられる。ここで $\rho_{\text{up}}, \rho_{\text{dwn}}$ は圧縮誤差の上限、$b$ はミニバッチサイズである。
  • メモリ機構は、特に双方向圧縮において、持続的な誤差を追跡・補正することで、圧縮誤差の影響を顕著に低減する。
  • メモリ機構がなければ、上行リンクにおける補正されない圧縮バイアスの影響により、漸近的分散が $(1 + \rho_{\text{up}})$ 倍に増加する。
  • 2つの提案手法により、部分的参加を効果的に処理し、実験的に検証された。これにより、1ラウンドあたり一部のワーカーのみが参加する状況下でも安定した収束が保証される。
  • Polyak-Ruppert平均化により、最終反復値の分散が低減され、一般化性能が向上し、収束境界がより厳密になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。