Skip to main content
QUICK REVIEW

[論文レビュー] Distributionally Robust Federated Averaging

Yuyang Deng, Mohammad Mahdi Kamani|arXiv (Cornell University)|Feb 25, 2021
Stochastic Gradient Optimization Techniques被引用数 20
ひとこと要約

本稿では、非同一分布のクライントデータ分布に対して分布的ロバスト性を達成する通信効率の良いフェデレーテッドラーニングアルゴリズムである、分布的ロバストフェデレーテッドアベレージング(DRFA)を提案する。DRFAは、周期的なグローバルアベレージングと適応的サンプリング、および新たなスナップショット方式を用い、混合パラメータの履歴を近似することで、通信回数を削減しながら、凸および非凸設定においても証明可能な高速収束を実現する。

ABSTRACT

In this paper, we study communication efficient distributed algorithms for distributionally robust federated learning via periodic averaging with adaptive sampling. In contrast to standard empirical risk minimization, due to the minimax structure of the underlying optimization problem, a key difficulty arises from the fact that the global parameter that controls the mixture of local losses can only be updated infrequently on the global stage. To compensate for this, we propose a Distributionally Robust Federated Averaging (DRFA) algorithm that employs a novel snapshotting scheme to approximate the accumulation of history gradients of the mixing parameter. We analyze the convergence rate of DRFA in both convex-linear and nonconvex-linear settings. We also generalize the proposed idea to objectives with regularization on the mixture parameter and propose a proximal variant, dubbed as DRFA-Prox, with provable convergence rates. We also analyze an alternative optimization method for regularized cases in strongly-convex-strongly-concave and non-convex (under PL condition)-strongly-concave settings. To the best of our knowledge, this paper is the first to solve distributionally robust federated learning with reduced communication, and to analyze the efficiency of local descent methods on distributed minimax problems. We give corroborating experimental evidence for our theoretical results in federated learning settings.

研究の動機と目的

  • フェデレーテッドラーニングにおけるデータの非同一性という課題に取り組むこと。特に、標準的なFedAvgモデルでは非i.i.d.クライントデータに対して一般化性能が著しく低下する点に焦点を当てる。
  • 混合重みの頻繁なグローバル更新を必要とせず、分布的ロバスト性を維持できる通信効率の良いアルゴリズムの開発を目的とする。
  • 周期的なアベレージングと適応的サンプリングを用いて、通信オーバーヘッドを最小限に抑えながら、多様なクライントデータ分布にわたるロバストな一般化を実現すること。
  • 局所勾配降下法の分散ミニマックス問題における収束速度を理論的に分析すること。これは先行研究におけるギャップである。
  • プロキシマル変種であるDRFA-Proxを用いて正則化目的関数へとフレームワークを拡張し、理論的収束保証を提供すること。

提案手法

  • DRFAを提案する。これは、局所モデルを周期的に同期し、混合パラメータλのグローバル更新を同期ラウンドでのみ行うフェデレーテッドアルゴリズムである。
  • 混合パラメータλの履歴勾配の蓄積を近似するためのスナップショット方式を導入し、λの更新頻度が低いことによる補償を実現する。
  • 現在のλ値に基づいてクライントを適応的にサンプリングすることで、アベレージング中の収束性とロバスト性を向上させる。
  • 凸線形および非凸線形設定における収束を分析し、O(1/T)のサブ最適性バウンドを確立する。
  • 正則化目的関数を扱うためにプロキシマル更新を用いるDRFA-Proxを構築し、強凸強凸および非凸(PL条件)強凸設定下での収束解析を実施する。
  • λの遅延更新に起因する誤差を制御するための新しい技術的ツールを用いる。特に、λ推定誤差の幾何的減衰と勾配分散の制御を含む。

実験結果

リサーチクエスチョン

  • RQ1非同一分布データに対して分布的ロバスト性を維持できる通信効率の良いフェデレーテッドラーニングアルゴリズムを設計できるか?
  • RQ2混合パラメータλのグローバル更新が頻繁でない分散ミニマックス最適化において、局所勾配降下法の理論的収束をどのように達成できるか?
  • RQ3部分的なクライント参加と周期的アベレージングの下で、凸および非凸設定におけるDRFAの収束速度はどのようになるか?
  • RQ4正則化が分布的ロバストフェデレーテッドラーニングの収束に与える影響は何か?また、理論的保証を有するプロキシマル変種を設計できるか?
  • RQ5通信効率の良い設定において、混合パラメータの履歴勾配を近似するスナップショットの使用を理論的に正当化できるか?

主な発見

  • DRFAは、通信頻度τおよびデータの非同一性に明示的な依存関係を示すO(1/T)の収束レートを達成する。
  • アルゴリズムの収束は、λ推定の初期誤差、条件数κ、勾配分散を含む項によって制限され、τに依存する減衰率を示す。
  • 非凸設定においてポリャク=ロジャシエフスキー(PL)条件が成り立つ場合、DRFAはO(1/T)の収束を達成し、凸性を超えるロバスト性を示す。
  • 強凸強凸および非凸(PL)強凸設定下で、プロキシマル変種DRFA-ProxはO(1/T)の収束を達成し、正則化への拡張が可能であることを示す。
  • 実験結果は理論的予測を裏付け、FedAvgと比較して非同一分布フェデレーテッドデータ上でのロバスト性と一般化性能の向上を示す。
  • 解析により、スナップショット機構のおかげで、λの更新が稀であっても通信効率が維持されることを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。