Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Federated Learning with Auto-Tuned Clients

Junhyung Lyle Kim, Mohammad Taha Toghani|arXiv (Cornell University)|Jun 19, 2023
Privacy-Preserving Technologies in DataComputer Science被引用数 3
ひとこと要約

本稿では、非独立同分布(non-IID)データ、異なるモデルアーキテクチャ、異種のデータ分布といった多様なフェデレーテッドラーニング(FL)設定において、追加のチューニングを要せず、標準的なSGD、Adam、Adagradを凌駕する最先端の性能を達成する、ローカル関数の滑らかさに基づいて各クライアントの学習率を自動的に調整するクライアント適応型ステップサイズルールである$\Delta$-SGDを提案する。この手法は、手動によるハイパーパramータチューニングの必要性を排除する。

ABSTRACT

Federated learning (FL) is a distributed machine learning framework where the global model of a central server is trained via multiple collaborative steps by participating clients without sharing their data. While being a flexible framework, where the distribution of local data, participation rate, and computing power of each client can greatly vary, such flexibility gives rise to many new challenges, especially in the hyperparameter tuning on the client side. We propose $Δ$-SGD, a simple step size rule for SGD that enables each client to use its own step size by adapting to the local smoothness of the function each client is optimizing. We provide theoretical and empirical results where the benefit of the client adaptivity is shown in various FL scenarios.

研究の動機と目的

  • データおよびシステムの非均一性に起因して、固定またはグローバルに共有される学習率では最適でない性能が得られるフェデレーテッドラーニングにおけるクライアント側のハイパーパramータチューニングの課題に対処すること。
  • 特に変動するデータ分布、モデルアーキテクチャ、クライアント参加パターン下で、クライアント最適化手法に広範なグリッドサーチを要する既存手法の限界を克服すること。
  • ローカル関数の湾曲度に応じて動的にステップサイズを調整するクライアント適応型最適化戦略を開発し、手動の介入なしに収束性と最終的なモデル精度を向上させること。
  • 非IIDsデータや異なるモデル複雑度を含む多様なフェデレーテッドラーニングシナリオにおいて、クライアント固有のステップサイズ適応が、強固な性能を発揮することの重要性を示すこと。
  • 実世界のFLデプロイメントにおいて、固定またはグローバルに共有される学習率よりも適応的クライアント学習率が優れていることを理論的および実騴的根拠で裏付けること。

提案手法

  • クライアントの損失関数のローカル滑らかさに基づいてクライアント固有の学習率を計算する、新しいステップサイズルールである$\Delta$-SGDを提案する。このルールは、ローカルヘッシアンのスペクトルノルムの動的推定値を用いる。
  • クライアントレベルの適応的学習率更新ルールを導入する:$\eta_i^t = \frac{\Delta_i^t}{\|\nabla f_i(x^t)\|}$、ここで$\Delta_i^t$は連続するステップ間の勾配差分から得られるローカル滑らかさの代理変数である。
  • 標準的なFedAvgフレームワークに$\Delta$-SGDを統合し、通信および集約プロトコルを変更せずにクライアントごとの最適化適応性を実現する。
  • 勾配差分の移動平均を用いてローカル滑らかさを推定することで、ヘッシアンの明示的計算を回避し、リソース制限のあるクライアントでも計算効率を確保する。
  • サーバー側の集約方法を変更せず、クライアント側の最適化手法のみを置き換えることで、既存のフェデレーテッドラーニングシステムとの後方互換性を維持する。
  • トレーニング中に継続的にローカル滑らかさ推定値を更新することで、データ分布の変化やクライアントの計算速度の変化に対しても自動的に適応可能にする。
Figure 1: Illustration of the effect of not properly tuning the client step sizes. In (A), each client optimizer uses the best step size from grid-search. Then, the same step size from (A) is intentionally used in settings (B) and (C). Only $\Delta$ -SGD works well across all settings without additi
Figure 1: Illustration of the effect of not properly tuning the client step sizes. In (A), each client optimizer uses the best step size from grid-search. Then, the same step size from (A) is intentionally used in settings (B) and (C). Only $\Delta$ -SGD works well across all settings without additi

実験結果

リサーチクエスチョン

  • RQ1クライアント適応型ステップサイズルールは、多様なデータおよびシステム非均一性にわたるフェデレーテッドラーニングにおいて、手動によるハイパーパramータチューニングの必要性を顕著に低減できるか?
  • RQ2ローカル関数の滑らかさに基づくクライアント固有の学習率適応は、固定またはグローバルに共有される学習率と比較して、収束速度および最終的なモデル精度において優れているか?
  • RQ3$\Delta$-SGDは、異なるモデルアーキテクチャ(例:ResNet-18 対 ResNet-50)および異なるデータ分布(例:CIFAR-10 対 CIFAR-100)において、再チューニングなしに強力な性能を維持できるか?
  • RQ4異種のFL設定において、クライアント側の適応性は、Adam や Adagrad などの適応的最適化手法をどのように上回るか?
  • RQ5データが非IIDsであるか、クライアントのデータサイズが異なる場合、標準的なフェデレーテッド最適化手法の性能はステップサイズの選択にどの程度敏感か?

主な発見

  • CIFAR-100にResNet-50を適用した場合、$\Delta$-SGDはすべてのベースラインで最高のテスト精度(57.5%)を達成し、Adam(51.1%)およびAdagrad(44.5%)を6ポイント以上上回った。
  • ResNet-18を用いたCIFAR-10では、$\Delta$-SGDが80.4%のテスト精度を達成し、非減衰型SGD(80.7%)に次ぐ2位であり、同じ条件下でSGDM(75.0%)およびAdam(79.9%)を顕著に上回った。
  • クライアントごとのデータサイズが異種(100~500件/クライアント)である状況でも、$\Delta$-SGDは強力な性能を維持し、MOONを用いたCIFAR-10では83.1%の精度を達成し、Adam(82.4%)およびAdagrad(81.3%)を上回った。
  • 非IIDsデータ、変動するモデル複雑度、MOONのようなメモリ制限付き環境を含む、すべてのテストシナリオにおいて、$\Delta$-SGDはすべてのベースライン(適応的最適化手法を含む)を一貫して上回った。
  • あるタスク(例:ResNet-18を用いたCIFAR-10)でチューニングされた同じステップサイズルールを用いても、$\Delta$-SGDは他のタスク(例:CNNを用いたMNIST、ResNet-50を用いたCIFAR-100)においても強力な性能を維持する一方、他の手法は著しく劣化または失敗する。
  • チューニング済みと非チューニングベースラインの間の性能差は$\Delta$-SGDによって解消され、すべての実験でハイパーパramータチューニングなしにほぼ最適な性能を達成した。
Figure 2: The effect of stronger heterogeneity on different client optimizers, induced by the Dirichlet concentration parameter $\alpha\in\{0.01,0.1,1\}$ . $\Delta$ -SGD remains robust performance in all cases, whereas other methods show significant performance degradation when changing the level of
Figure 2: The effect of stronger heterogeneity on different client optimizers, induced by the Dirichlet concentration parameter $\alpha\in\{0.01,0.1,1\}$ . $\Delta$ -SGD remains robust performance in all cases, whereas other methods show significant performance degradation when changing the level of

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。