Skip to main content
QUICK REVIEW

[論文レビュー] Local SGD: Unified Theory and New Efficient Methods

Eduard Gorbunov, Filip Hanzely|arXiv (Cornell University)|Nov 3, 2020
Stochastic Gradient Optimization Techniques参考文献 54被引用数 10
ひとこと要約

本稿は、分散学習およびフェデレーテッドラーニングにおける凸および強く凸な設定において、局所的SGD手法を統一的に分析する理論的枠組みを提示する。本稿は、非均質なデータ、可変な局所ステップ数、および高度な勾配推定器(シフト付きバージョンを含む)をサポートする一般化されたアルゴリズム構造を導入し、データの均質性を要件としない初の線形収束を達成する局所的SGD手法の実現を可能にする。

ABSTRACT

We present a unified framework for analyzing local SGD methods in the convex and strongly convex regimes for distributed/federated training of supervised machine learning models. We recover several known methods as a special case of our general framework, including Local-SGD/FedAvg, SCAFFOLD, and several variants of SGD not originally designed for federated learning. Our framework covers both the identical and heterogeneous data settings, supports both random and deterministic number of local steps, and can work with a wide array of local stochastic gradient estimators, including shifted estimators which are able to adjust the fixed points of local iterations for faster convergence. As an application of our framework, we develop multiple novel FL optimizers which are superior to existing methods. In particular, we develop the first linearly converging local SGD method which does not require any data homogeneity or other strong assumptions.

研究の動機と目的

  • 分散およびフェデレーテッドラーニングにおける局所的確率的1次最適化手法を統一的に分析する一般化された枠組みの構築を目的とする。
  • クライアント間で同一、非均質、および部分的に非均質(ζ-非均質)なデータが存在する多様な設定をサポートすること。
  • ランダムまたは決定的な可変な局所ステップ数と、シフト付き、分散低減、重要度サンプリング付きの変種を含む高度な勾配推定器を統合すること。
  • 特に、線形収束を達成する際にデータの均質性を要件としない最小限の仮定のもとで収束解析を可能とすること。
  • 本枠組みに基づき、既存手法を凌駆する新たな優れた最適化手法を体系的に導出すること。

提案手法

  • 通信インジケータ $ c_k \in \{0,1\} $ を用いてパラメータ化された、交互に局所更新とグローバル平均化を繰り返す一般化されたアルゴリズム族を提案。$ c_k = 1 $ のとき同期が発生する。
  • 局所勾配推定器の挙動を捉えるパラメトリック仮定(仮定2.3)を導入。シフト付き勾配や分散低減変種を含む。
  • 問題の滑らかさ、分散、および局所ステップ数に基づく、タイトな収束レートの上限を導出。$ \mathcal{O}\left(\frac{a}{\gamma_0 K} + \frac{\sqrt{ab_1}}{K} + \cdots \right) $ と表現され、$ a, b_1, b_2, c_1, c_2 $ は局所推定器の特性に依存する。
  • 複数の勾配推定器タイプをサポート:分散の上限(UBV)、期待される滑らかさ(ES)、および単純または分散低減変種。
  • 既存手法(例:FedAvg、SCAFFOLD)を本枠組みで再現し、S*-Local-SGD や S-Local-SVRG といった新規手法を導出。
  • シフト付き勾配の固定点補正効果を分離する新しい解析技術を用い、データの均質性を仮定しない収束を可能にする。

実験結果

リサーチクエスチョン

  • RQ1凸および強く凸な範囲にわたり、多様な局所的SGD手法を統一的に分析できる理論的枠組みを1つに統合できるか?
  • RQ2固定点誤差を補正するため、シフト付き勾配推定器を局所的SGDに体系的に統合する方法は何か?
  • RQ3データの均質性を仮定しない非均質なデータ分布下でも、局所的SGDの収束保証は得られるか?
  • RQ4既存手法を凌駕する、より効率的な局所的SGDの変種を、統一的枠組みから体系的に導出できるか?
  • RQ5可変な局所ステップ数および高度な勾配推定器(例:重要度サンプリング、分散低減)が収束レートに与える影響は何か?

主な発見

  • 本枠組みは、FedAvg や SCAFFOLD といった既存手法を特別なケースとして回復し、その一般性を示している。
  • 本稿は、データの均質性を要件とせず、強いデータ類似性仮定も不要な初の線形収束を達成する局所的SGD手法を導出している。
  • UBVと非均質データを用いたS*-Local-SGDの変種では、収束レートが $ \mathcal{O}\left(\frac{\sigma^2}{nK} + \frac{L^2}{K} \right) $ となり、既知のレートと一致するが、より弱い仮定のもとで達成される。
  • ESに基づく推定器は重要度サンプリングを可能とし、追加の滑らかさや分散の仮定なしに収束を達成できる。
  • 本枠組みにより、SS-Local-SGD や S-Local-SVRG といった新たな最適化手法の設計が可能となり、非均質データ下で改善された収束を達成する。
  • 解析により、シフト付き勾配推定器が固定点補正を効果的に行い、特に非i.i.d.設定下で収束を著しく改善することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。