Skip to main content
QUICK REVIEW

[論文レビュー] FedPAGE: A Fast Local Stochastic Gradient Method for Communication-Efficient Federated Learning

Haoyu Zhao, Zhize Li|arXiv (Cornell University)|Aug 10, 2021
Stochastic Gradient Optimization Techniques参考文献 43被引用数 8
ひとこと要約

FedPAGEは、FedAvgにおける標準的な局所的SGDを最適なPAGE確率的勾配法に置き換えることで、通信効率の高いフェデレーテッドラーニングアルゴリズムを提案する。凸問題では$O(N^{3/4}/(S\epsilon))$、非凸問題では$O((\sqrt{N}+S)/(S\epsilon^2))$の通信複雑度を達成し、状態の最良の通信複雑度を実現する。これは、通常のクライアントサンプリング設定下でSCAFFOLDをそれぞれ$N^{1/4}$および$N^{1/6}S^{1/3}$の要因で上回る。

ABSTRACT

Federated Averaging (FedAvg, also known as Local-SGD) (McMahan et al., 2017) is a classical federated learning algorithm in which clients run multiple local SGD steps before communicating their update to an orchestrating server. We propose a new federated learning algorithm, FedPAGE, able to further reduce the communication complexity by utilizing the recent optimal PAGE method (Li et al., 2021) instead of plain SGD in FedAvg. We show that FedPAGE uses much fewer communication rounds than previous local methods for both federated convex and nonconvex optimization. Concretely, 1) in the convex setting, the number of communication rounds of FedPAGE is $O(\frac{N^{3/4}}{Sε})$, improving the best-known result $O(\frac{N}{Sε})$ of SCAFFOLD (Karimireddy et al.,2020) by a factor of $N^{1/4}$, where $N$ is the total number of clients (usually is very large in federated learning), $S$ is the sampled subset of clients in each communication round, and $ε$ is the target error; 2) in the nonconvex setting, the number of communication rounds of FedPAGE is $O(\frac{\sqrt{N}+S}{Sε^2})$, improving the best-known result $O(\frac{N^{2/3}}{S^{2/3}ε^2})$ of SCAFFOLD (Karimireddy et al.,2020) by a factor of $N^{1/6}S^{1/3}$, if the sampled clients $S\leq \sqrt{N}$. Note that in both settings, the communication cost for each round is the same for both FedPAGE and SCAFFOLD. As a result, FedPAGE achieves new state-of-the-art results in terms of communication complexity for both federated convex and nonconvex optimization.

研究の動機と目的

  • フェデレーテッドラーニングにおける通信複雑度を、標準的なFedAvgアルゴリズムを改善することで低減すること。
  • 異種的かつ地理的に分散されたクライアント間で、分散型かつプライバシー保護型の学習における通信ボトルネックを解決すること。
  • 凸および非凸最適化設定において、モデルの精度を維持したまま、より少ない通信ラウンドで収束を達成すること。
  • 局所的更新に最適なPAGE手法を活用し、SCAFFOLDのような先行する局所的手法よりも優れた収束速度を実現すること。

提案手法

  • FedAvgにおける局所的SGDステップを、収束効率を向上させるためのPAGE(誤差補正付きプロキシ加速勾配)法に置き換える。
  • ノイズを低減し収束を加速するために、分散低減勾配推定と適応的ステップサイズを組み合わせたハイブリッド局所的更新戦略を採用する。
  • 通信コストとモデル精度のバランスを取るために、1ラウンドあたり$S$個のクライアントをサンプリングするクライアントサンプリングを採用する。実際の運用では$S \leq \sqrt{N}$が一般的である。
  • 滑らかさと分散の有界性の仮定の下で、タイトな通信複雑度の境界を導出するための新しい解析フレームワークを導入する。
  • 通信ラウンド数を最小化するために、グローバル更新と局所更新の最適ステップサイズ$\eta_g$および$\eta_l$を導出する。
  • Lyapunovスタイルの解析を適用し、期待される最適性の不備と勾配ノルムをバインドすることで、凸および非凸設定の両方で収束保証を可能にする。

実験結果

リサーチクエスチョン

  • RQ1局所的SGDをより高度な確率的勾配法に置き換えることで、FedAvgの通信複雑度を著しく低減できるか?
  • RQ2凸および非凸問題において、通信ラウンドの観点から、FedPAGEはSCAFFOLDと比較してどのように性能を発揮するか?
  • RQ3標準的な滑らかさと分散の有界性の仮定の下で、FedPAGEの理論的通信複雑度は何か?
  • RQ4通信コストが$S \ll N$の小さなクライアントサブセットのみをサンプリングする場合でも、FedPAGEはその利点を維持できるか?
  • RQ5大規模なフェデレーテッドラーニング環境において、FedPAGEはモデル精度を保持したまま、より少ない通信ラウンドで収束を達成できるか?

主な発見

  • 凸設定では、FedPAGEは$O(N^{3/4}/(S\epsilon))$の通信複雑度を達成し、SCAFFOLDの$O(N/(S\epsilon))$を$N^{1/4}$の要因で改善する。
  • 非凸設定では、FedPAGEは通信ラウンドを$O((\sqrt{N}+S)/(S\epsilon^2))$に低減し、$S \leq \sqrt{N}$の条件下でSCAFFOLDの$O(N^{2/3}/(S^{2/3}\epsilon^2))$を$N^{1/6}S^{1/3}$の要因で改善する。
  • 通信コストはSCAFFOLDと同等のため、通信負荷を増加させることなく、より優れた性能を達成できる。
  • FedPAGEは、実用的なフェデレーテッドラーニング状況で一般的な分散の有界性(BV)仮定下でも、その理論的利点を維持する。
  • FedPAGEの収束速度は、凸および非凸問題の両方において通信複雑度の観点で最適であり、新たな状態の最良を確立する。
  • クライアントサンプリングに対して頑健であり、実世界のフェデレーテッドラーニングで一般的な小規模なクライアントサブセット$S$が1ラウンドあたり選択されても、良好に動作する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。