Skip to main content
QUICK REVIEW

[論文レビュー] Achieving Linear Speedup with Partial Worker Participation in Non-IID Federated Learning

Haibo Yang, Minghong Fang|arXiv (Cornell University)|Jan 26, 2021
Privacy-Preserving Technologies in Data参考文献 29被引用数 73
ひとこと要約

この論文は、二端の学習率を用いる FedAvg が、非IIDデータと部分的なワーカ参加の下で線形収束スピードアップを達成することを証明する。適切に調整された場合、局所更新を T/m まで増やすことが収束を助ける。

ABSTRACT

Federated learning (FL) is a distributed machine learning architecture that leverages a large number of workers to jointly learn a model with decentralized data. FL has received increasing attention in recent years thanks to its data privacy protection, communication efficiency and a linear speedup for convergence in training (i.e., convergence performance increases linearly with respect to the number of workers). However, existing studies on linear speedup for convergence are only limited to the assumptions of i.i.d. datasets across workers and/or full worker participation, both of which rarely hold in practice. So far, it remains an open question whether or not the linear speedup for convergence is achievable under non-i.i.d. datasets with partial worker participation in FL. In this paper, we show that the answer is affirmative. Specifically, we show that the federated averaging (FedAvg) algorithm (with two-sided learning rates) on non-i.i.d. datasets in non-convex settings achieves a convergence rate $\\mathcal{O}(\\frac{1}{\\sqrt{mKT}} + \\frac{1}{T})$ for full worker participation and a convergence rate $\\mathcal{O}(\\frac{\\sqrt{K}}{\\sqrt{nT}} + \\frac{1}{T})$ for partial worker participation, where $K$ is the number of local steps, $T$ is the number of total communication rounds, $m$ is the total worker number and $n$ is the worker number in one communication round if for partial worker participation. Our results also reveal that the local steps in FL could help the convergence and show that the maximum number of local steps can be improved to $T/m$ in full worker participation. We conduct extensive experiments on MNIST and CIFAR-10 to verify our theoretical results.

研究の動機と目的

  • ワーカ間でデータが非同一分布(non-IID)であり、ワーカーが部分的に参加する可能性があるフェデレーテッドラーニングの動機づけ。
  • 非IID設定下での二端の学習率を用いる FedAvg の収束特性を分析する。
  • 部分参加の下でワーカー数に対する線形スピードアップが達成可能かを判定する。
  • 局所更新ステップ数 K が収束と通信効率に与える影響を定量化する。

提案手法

  • 局所学習率を用いて各参加ワーカーが K 個の局所 SGD ステップを実行し、サーバーはモデルを更新するために別個のグローバル学習率を使用する一般化 FedAvg を研究する。
  • データのヘテロ性をモデル化するために、リプシッツ連続勾配、局所勾配推定量の偏りなし、局所/全体の分散が有界であると仮定する。
  • 非凸設定において、全参加と部分参加の両方の収束境界を導出する。
  • 適切な二端の学習率が、全参加で O(1/√(mKT) + 1/T)、部分参加で O(√K/√(nT) + 1/T) の収束速度をもたらすことを示す。
  • 線形スピードアップを達成するために局所ステップ数の最大値は K ≤ T/m まで大きくできることを示し、適切なパラメータ選択とともに局所ステップが有益であることを示す。
  • MNIST および CIFAR-10 の各種モデルで理論的結果を実験で検証する。

実験結果

リサーチクエスチョン

  • RQ1各ラウンドに参加するワーカーの一部のみの場合、非IIDデータを前提としたフェデレーテッドラーニングで線形スピードアップを達成できるか。
  • RQ2二端の学習率(局所とサーバーの学習率が異なる場合)が、非IIDデータおよび部分参加下の収束にどう影響するか。
  • RQ3局所更新数 K、総ラウンド数 T、達成される非IID FL における収束速度の関係は何か。
  • RQ4局所更新ステップは非IIDデータ下で収束を助けるか妨げるか、また K を T/m までとする条件は何か。

主な発見

  • 非IIDデータを含む非凸問題に対して、二端の学習率を用いる FedAvg は全参加で O(1/√(mKT) + 1/T)、部分参加で O(√K/√(nT) + 1/T) の収束速度を達成し、T が大きい場合に線形スピードアップを示唆する。
  • 線形スピードアップを維持するために許容される最大局所更新は K ≤ T/m へと増やせ、ラウンド数を減らすことで通信効率を向上させる。
  • 勾配の有界性仮定を要求せず、二端の学習率アプローチが分散項を抑制し望ましい収束挙動を達成することを示す。
  • 適切な学習率スケジューリングとともに局所更新(より大きな K)は収束を促進でき、非IID FL において局所ステップが性能を損なうとする以前の研究とは対照的である。
  • MNIST および CIFAR-10 の実験は理論的レートを裏付け、非IID性、参加ワーカー数、局所ステップが収束と精度に及ぼす影響を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。