Skip to main content
QUICK REVIEW

[論文レビュー] Effective Federated Adaptive Gradient Methods with Non-IID Decentralized Data

Qianqian Tong, Guannan Liang|arXiv (Cornell University)|Sep 14, 2020
Privacy-Preserving Technologies in Data参考文献 32被引用数 14
ひとこと要約

本稿では、非IIDおよび非バランスな分散データ設定における性能低下を解消するため、補正された学習率を備えたフェデレーテッド・アダプティブ勾配法(AGM)の族を提案する。非凸最適化において、最初に1次停留点への収束を理論的に確立し、部分的なデバイス参加下でもs-FedAdamのような補正済みAGMが部分線形収束率を達成することを示している。

ABSTRACT

Federated learning allows loads of edge computing devices to collaboratively learn a global model without data sharing. The analysis with partial device participation under non-IID and unbalanced data reflects more reality. In this work, we propose federated learning versions of adaptive gradient methods - Federated AGMs - which employ both the first-order and second-order momenta, to alleviate generalization performance deterioration caused by dissimilarity of data population among devices. To further improve the test performance, we compare several schemes of calibration for the adaptive learning rate, including the standard Adam calibrated by $ε$, $p$-Adam, and one calibrated by an activation function. Our analysis provides the first set of theoretical results that the proposed (calibrated) Federated AGMs converge to a first-order stationary point under non-IID and unbalanced data settings for nonconvex optimization. We perform extensive experiments to compare these federated learning methods with the state-of-the-art FedAvg, FedMomentum and SCAFFOLD and to assess the different calibration schemes and the advantages of AGMs over the current federated learning methods.

研究の動機と目的

  • フェデレーテッド・ラーニングにおけるデータの非IID性および非バランスな分布が引き起こす一般化性能の低下を是正すること。
  • 部分的デバイス参加と非IIDデータ下でのフェデレーテッド・アダプティブ勾配法の理論的基盤を構築すること。
  • ε、p、活性化関数に基づく方法を含む、複数の学習率補正戦略を比較すること。
  • 現実的なFL制約下で、1次および2次モーメントを有するフェデレーテッドAGMの収束を実証すること。

提案手法

  • 補正された学習率を備えたフェデレーテッド・アダプティブ勾配法(AGM)の族、特にFedAdamとFedAMSGradを導入する。
  • ソフトプラス関数を用いた新規な補正スキームを採用し、適応的学習率の安定化を図ったs-FedAdamを提案する。
  • 各クライアントが更新を送信する前に局所的に最適化するための、内側反復回数Kを有するローカル更新ルールを採用する。
  • クライントの重み$ p_i $を用いたサーバー側の平均化ルールを適用し、非IIDおよび非バランスなデータ下でも収束を保証する。
  • 理論的分析では、L-スムーズ性、勾配の有界性、および補正済みモーメント項による分散制御を用いる。
  • 勾配ノルムの減衰および分散項に関する補題を用いて収束バウンドを導出し、部分線形収束率に至る。

実験結果

リサーチクエスチョン

  • RQ1補正された学習率を備えたフェデレーテッド・アダプティブ勾配法は、非IIDおよび非バランスなデータ分布下でも収束するか?
  • RQ2ε、p、ソフトプラス関数といった異なる補正戦略は、フェデレーテッドAGMにおける収束性および一般化性能にどのように影響するか?
  • RQ3部分的デバイス参加下で、1次および2次モーメントを有するフェデレーテッドAGMの理論的収束速度は何か?
  • RQ4非凸設定下で、s-FedAdamはε-FedAdamおよびp-FedAdamに比べて収束速度がどのように異なるか?

主な発見

  • 提案されたs-FedAdamは、$ O\left(\sqrt{\frac{\beta(1+1/S)^{3/2}}{T}} + \frac{K\sigma_g^2}{T} + \sqrt{\frac{\beta^3(1+1/S)^{5/2}}{K^2T}} \right) $ の部分線形収束率を達成し、1次停留点への収束を証明した。
  • 理論的分析により、非IIDおよび非バランスなデータ下、部分的デバイス参加下でも補正済みフェデレーテッドAGMの収束が保証された。
  • ソフトプラス関数による改善された補正のおかげで、s-FedAdamはε-FedAdamおよびp-FedAdamに比べて潜在的により良い収束速度を示した。
  • 実験結果では、特に高い非IIDレベル下で、フェデレーテッドAGMがFedAvg、FedMomentum、SCAFFOLDを上回る初期学習段階の性能を示した。
  • 収束速度は補正パラメータに敏感であり、$ K\gamma_t < \min\{\frac{1}{8L}, \sqrt{\frac{\mu_5}{10\mu_6}}\} $ を満たす場合に最適な性能が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。