Skip to main content
QUICK REVIEW

[논문 리뷰] Distributionally Robust Federated Averaging

Yuyang Deng, Mohammad Mahdi Kamani|arXiv (Cornell University)|2021. 02. 25.
Stochastic Gradient Optimization Techniques인용 수 20
한 줄 요약

이 논문은 분포로 보존된 페더레이티드 어웨이징(DRFA)을 제안하며, 이는 이질적인 클라이언트 데이터 분포에 걸쳐 악화되는 손실을 최소화함으로써 분포로 보존된 성능을 달성하는 통신 효율적인 페더레이티드 러닝 알고리즘이다. DRFA는 적응형 샘플링과 새로운 스크래치 패턴 기반의 기록된 혼합 파라미터 추정을 통해 주기적인 글로벌 평균화를 수행함으로써, 통신 라운드 수를 줄이며 볼록 및 비볼록 설정 모두에서 증명 가능한 빠른 수렴을 가능하게 한다.

ABSTRACT

In this paper, we study communication efficient distributed algorithms for distributionally robust federated learning via periodic averaging with adaptive sampling. In contrast to standard empirical risk minimization, due to the minimax structure of the underlying optimization problem, a key difficulty arises from the fact that the global parameter that controls the mixture of local losses can only be updated infrequently on the global stage. To compensate for this, we propose a Distributionally Robust Federated Averaging (DRFA) algorithm that employs a novel snapshotting scheme to approximate the accumulation of history gradients of the mixing parameter. We analyze the convergence rate of DRFA in both convex-linear and nonconvex-linear settings. We also generalize the proposed idea to objectives with regularization on the mixture parameter and propose a proximal variant, dubbed as DRFA-Prox, with provable convergence rates. We also analyze an alternative optimization method for regularized cases in strongly-convex-strongly-concave and non-convex (under PL condition)-strongly-concave settings. To the best of our knowledge, this paper is the first to solve distributionally robust federated learning with reduced communication, and to analyze the efficiency of local descent methods on distributed minimax problems. We give corroborating experimental evidence for our theoretical results in federated learning settings.

연구 동기 및 목표

  • 표준 FedAvg 모델이 비i.i.d. 클라이언트 데이터에서 일반화 성능이 떨어지는 문제를 해결하기 위해 데이터 이질성 문제를 다루는 것.
  • 혼합 가중치의 빈번한 글로벌 업데이트가 필요하지 않은 통신 효율적인 알고리즘을 개발하여 분포로 보존성을 유지하는 것.
  • 주기적인 평균화와 적응형 샘플링을 통해 통신 오버헤드를 최소화하면서 다양한 클라이언트 데이터 분포 간의 강건한 일반화를 달성하는 것.
  • 기존 연구에서 빈도가 낮은 혼합 파라미터 업데이트를 가진 분산 미니맥스 문제에서 국소 내림값 방법의 수렴 속도를 이론적으로 분석하는 데에 있어 격차를 메우는 것.
  • 프록시 업데이트를 사용한 확장된 프레임워크인 DRFA-Prox를 통해 정규화된 목표 함수로의 확장을 이루며, 증명 가능한 수렴 보장을 제공하는 것.

제안 방법

  • DRFA를 제안하며, 이는 주기적으로 로컬 모델을 동기화하고 혼합 파라미터 λ를 동기화 라운드에서만 업데이트하는 페더레이티드 알고리즘이다.
  • 혼합 파라미터 λ의 역사 기울기의 누적을 근사하기 위해 스크래치 패턴 기반의 새로운 기법을 도입하여, 희소한 업데이트로 인한 손실을 보완한다.
  • 현재 λ 값에 기반한 클라이언트의 적응형 샘플링을 통해 평균화 과정에서의 수렴성과 강건성을 향상시킨다.
  • 볼록-선형 및 비볼록-선형 설정에서의 수렴을 분석하여 O(1/T)의 하위최적성 경계를 확립한다.
  • 프록시 업데이트를 사용한 정규화된 목표 함수를 위한 DRFA-Prox를 개발하며, 강건-볼록-강건-볼록 및 비볼록(PL 조건)-강건-볼록 설정 하에서의 수렴 분석을 수행한다.
  • 지연된 λ 업데이트로 인한 오차를 극복하기 위해 기하급수적 감쇠와 기울기 분산 제어를 포함한 새로운 기술적 도구를 사용한다.

실험 결과

연구 질문

  • RQ1데이터 이질성에 대응하는 통신 효율적인 페더레이티드 러닝 알고리즘을 설계할 수 있는가?
  • RQ2혼합 파라미터의 빈번한 글로벌 업데이트가 없는 분산 미니맥스 최적화에서 국소 내림값 방법의 증명 가능한 수렴을 달성할 수 있는가?
  • RQ3부분적 클라이언트 참여와 주기적 평균화 조건 하에서 볼록 및 비볼록 설정에서 DRFA의 수렴 속도는 어떻게 되는가?
  • RQ4정규화가 분포로 보존된 페더레이티드 러닝의 수렴에 어떤 영향을 미치며, 이론적 보장을 갖춘 프록시 변형을 설계할 수 있는가?
  • RQ5스크래치 패턴을 사용해 혼합 파라미터의 역사 기울기 추정을 통신 효율적인 환경에서 이론적으로 정당화할 수 있는가?

주요 결과

  • DRFA는 하위최적성 갭에 대해 O(1/T)의 수렴 속도를 달성하며, 통신 빈도 τ와 데이터 이질성에 명시적인 의존성을 보인다.
  • 알고리즘의 수렴은 초기 λ 추정 오차, 조건수 κ, 기울기 분산을 포함한 항목들에 의해 제약을 받으며, 이들의 감쇠율은 τ에 따라 달라진다.
  • 비볼록 설정에서 Polyak-Łojasiewicz(PL) 조건이 성립할 경우, DRFA는 O(1/T) 수렴을 달성하여 볼록성 이외의 경우에도 강건성을 입증한다.
  • 강건-볼록-강건-볼록 및 비볼록(PL)-강건-볼록 설정 하에서 프록시 변형인 DRFA-Prox는 O(1/T) 수렴을 달성하며, 정규화된 목표 함수로의 프레임워크 확장을 가능하게 한다.
  • 실험 결과는 이론적 분석을 뒷받침하며, FedAvg에 비해 이질적인 페더레이티드 데이터에서 더 뛰어난 강건성과 일반화 성능을 보여준다.
  • 분석 결과, 스크래치 패턴 메커니즘이 역사 기울기 경향을 포착함으로써, λ 업데이트의 빈도가 낮더라도 통신 효율성이 유지됨을 밝혀냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.