[論文レビュー] FedLGA: Towards System-Heterogeneity of Federated Learning via Local Gradient Approximation
FedLGAは、計算能力が異なるデバイスからの不完全なローカル更新を用いて、アグリゲーター上で完全なローカル勾配を近似することで、システムの非均質性に対処する新しいフェデレーテッドラーニングアルゴリズムを提案する。わずか線形の計算オーバーヘッドで実装される交互ヘッセ推定法を用いることで、完全参加下では$\mathcal{O}\left(\frac{(1+\rho)}{\sqrt{NT}} + \frac{1}{T}\right)$、部分参加下では$\mathcal{O}\left(\frac{(1+\rho)\sqrt{E}}{\sqrt{TK}} + \frac{1}{T}\right)$の収束速度を達成し、非i.i.d.データおよび非均質なデバイス環境下で既存手法を上回る性能を発揮する。
Federated Learning (FL) is a decentralized machine learning architecture, which leverages a large number of remote devices to learn a joint model with distributed training data. However, the system-heterogeneity is one major challenge in a FL network to achieve robust distributed learning performance, which comes from two aspects: i) device-heterogeneity due to the diverse computational capacity among devices; ii) data-heterogeneity due to the non-identically distributed data across the network. Prior studies addressing the heterogeneous FL issue, e.g., FedProx, lack formalization and it remains an open problem. This work first formalizes the system-heterogeneous FL problem and proposes a new algorithm, called FedLGA, to address this problem by bridging the divergence of local model updates via gradient approximation. To achieve this, FedLGA provides an alternated Hessian estimation method, which only requires extra linear complexity on the aggregator. Theoretically, we show that with a device-heterogeneous ratio $ρ$, FedLGA achieves convergence rates on non-i.i.d. distributed FL training data for the non-convex optimization problems with $\mathcal{O} \left( \frac{(1+ρ)}{\sqrt{ENT}} + \frac{1}{T} ight)$ and $\mathcal{O} \left( \frac{(1+ρ)\sqrt{E}}{\sqrt{TK}} + \frac{1}{T} ight)$ for full and partial device participation respectively, where $E$ is the number of local learning epoch, $T$ is the number of total communication round, $N$ is the total device number and $K$ is the number of selected device in one communication round under partially participation scheme. The results of comprehensive experiments on multiple datasets show that FedLGA outperforms current FL methods against the system-heterogeneity.
研究の動機と目的
- データ非均質性およびデバイス非均質性に起因するフェデレーテッドラーニングにおけるシステム非均質性の課題に対処すること。
- 特に、異なるデバイスの計算能力に起因する不完全なローカル更新に起因するシステム非均質なFL問題を形式化すること。
- すべてのデバイスが完全なローカルトレーニングエポックを完了させる必要がない状況でも収束性と高い性能を実現する手法を開発すること。
- モデルの精度と収束保証を維持しつつ、リモートデバイスにおける計算オーバーヘッドを最小限に抑えること。
- 完全参加および部分参加のデバイス参加スキーム下での非凸最適化における理論的収束バウンドを提供すること。
提案手法
- 計算能力が異なるデバイスからの不完全なローカル更新を用いて最適勾配を近似する、新しいフェデレーテッドラーニングアルゴリズムであるFedLGAを提案する。
- デバイスでの完全なローカルトレーニングを要件とせず、アグリゲーター上で交互ヘッセ推定法を実装し、完全なローカル勾配を近似する。
- 部分的更新と完全な更新の乖離を緩和するために、プロキシ類似の更新ルールを導入し、収束性を安定化する。
- 追加計算のすべてをアグリゲーターで実行するようにアルゴリズムを設計し、リモートデバイスに追加コストを負担させない。
- 1回の通信ラウンドあたり$\mathcal{O}(d)$の追加コストで済む線形複雑度のヘッセ近似技術を用いて効率性を維持する。ここで$d$はモデル次元を表す。
- 部分参加を許容する最適化問題を定式化し、デバイスがすべてのローカルエポックを完了していない場合でも貢献可能であるように設計する。
実験結果
リサーチクエスチョン
- RQ1計算能力の非均質性に起因する不完全なローカル更新をデバイスが提供する場合、フェデレーテッドラーニングシステムは収束を達成できるか?
- RQ2非均質なデバイスからの部分的ローカル更新のみを用いて、アグリゲーターは完全なローカル勾配をどのように近似できるか?
- RQ3部分デバイス参加を伴うシステム非均質な条件下で、フェデレーテッドラーニングアルゴリズムの理論的収束速度はどの程度か?
- RQ4提案手法は、エッジデバイスにおける通信および計算オーバーヘッドを最小限に抑えると同時に、高いモデル精度を維持できるか?
- RQ5非i.i.d.および非均質な環境下で、FedProx、FedAvg、Scaffoldといった既存手法と比較して、提案手法は収束性および耐障害性において優れているか?
主な発見
- 完全参加下では、$\mathcal{O}\left(\frac{(1+\rho)}{\sqrt{NT}} + \frac{1}{T}\right)$の理論的収束速度を達成し、ここで$\rho$はデバイス非均質性比を表す。
- 部分参加下では、$\mathcal{O}\left(\frac{(1+\rho)\sqrt{E}}{\sqrt{TK}} + \frac{1}{T}\right)$の収束速度を達成し、$E$はローカルエポック数、$T$は総ラウンド数、$K$は1ラウンドあたり選択されるデバイス数を表す。
- 複数の実世界データセットを用いた包括的な実験により、FedLGAはテスト精度、通信効率、総トレーニング時間の観点でFedProx、FedAvg、Scaffoldを上回ることが示された。
- アグリゲーターでの計算オーバーヘッドは線形に増加するため、大規模なFLシステムにおいてスケーラブルかつ実用的である。
- 低計算能力のデバイスが部分的更新を提供する場合でも、FedLGAは強力な耐性を示し、システム非均質性に対して高い耐性を示した。
- FedLGAにおけるヘッセ近似法により、完全なローカルトレーニングを要件とせず、正確な勾配推定が可能となり、デバイス同期の必要性が低減された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。