Skip to main content
QUICK REVIEW

[논문 리뷰] Local Adaptivity in Federated Learning: Convergence and Consistency

Jianyu Wang, Zheng Xu|arXiv (Cornell University)|2021. 06. 04.
Privacy-Preserving Technologies in Data참고 문헌 38인용 수 21
한 줄 요약

이 논문은 클라이언트에서 적응형 최적화기(예: AdaGrad)를 사용하여 피에드레이티드 학습에서 局소 적응성(local adaptivity)을 제안한다. 이는 수렴 속도를 가속화하지만, 비소거적 해법 편향(non-vanishing solution bias)을 유도한다. 이러한 모순을 해결하기 위해 저자는 상태 재시작(state-restart) 메커니즘과 보정 기법을 도입하였으며, 실제 피에드레이티드 작업에서 기준 방법보다 더 빠른 수렴 속도와 높은 테스트 정확도를 입증하였다.

ABSTRACT

The federated learning (FL) framework trains a machine learning model using decentralized data stored at edge client devices by periodically aggregating locally trained models. Popular optimization algorithms of FL use vanilla (stochastic) gradient descent for both local updates at clients and global updates at the aggregating server. Recently, adaptive optimization methods such as AdaGrad have been studied for server updates. However, the effect of using adaptive optimization methods for local updates at clients is not yet understood. We show in both theory and practice that while local adaptive methods can accelerate convergence, they can cause a non-vanishing solution bias, where the final converged solution may be different from the stationary point of the global objective function. We propose correction techniques to overcome this inconsistency and complement the local adaptive methods for FL. Extensive experiments on realistic federated training tasks show that the proposed algorithms can achieve faster convergence and higher test accuracy than the baselines without local adaptivity.

연구 동기 및 목표

  • 피에드레이티드 학습에서 국소 클라이언트 업데이트에 적응형 최적화 방법(예: AdaGrad)을 사용할 경우의 영향을 조사하는 것.
  • 순수하게 국소 적응형 최적화기를 사용할 경우, 전역 목표의 정적점에서 벗어나지 않는 비소거적 해법 편향이 발생한다는 것을 규명하는 것.
  • 통신 라운드 간 최적화기 상태의 불연속성 문제를 해결하기 위해 상태 재시작 메커니즘을 제안하는 것.
  • 국소 적응성의 이점을 유지하면서도 전역 목표와의 일관성을 복원하기 위한 보정 기법을 개발하는 것.
  • 실제 피에드레이티드 학습 작업에서 제안된 방법이 더 빠른 수렴 속도와 높은 테스트 정확도를 달성한다는 것을 경험적으로 검증하는 것.

제안 방법

  • 상태 재시작 메커니즘 제안: 각 통신 라운드의 시작 시 클라이언트 최적화기 상태(예: 전처리기, 동량 버퍼)를 재초기화하여 상태 기반 최적화기에서 발생하는 불연속성 문제를 해결한다.
  • 최적화기의 형태에 따라 달라지는 연산자 $\mathbb{E}[\mathcal{A}]$ 를 포함하는 고정점 문제로 FedOpt를 재구성함으로써, 수렴성과 편향에 대한 이론적 분석이 가능하도록 한다.
  • 국소 적응형 방법이 유도하는 편향을 상쇄하기 위해 글로벌 업데이트 단계를 보정하는 기법을 도입하여, 정확한 해에 수렴하도록 보장한다.
  • 이론적 분석 결과, 국소 적응성이 최적화 경로의 조건수를 개선하지만, 고정점이 전역 최소값에서 벗어나게 할 수 있음을 확인하였다.
  • 클라이언트 최적화기(ClientOpt)에 적응형 방법(예: AdaGrad)을 사용하고 서버 최적화기(ServerOpt)에 표준 또는 적응형 업데이트를 사용하는 수정된 FedOpt 프레임워크를 사용하며, 글로벌 업데이트 단계에 보정을 적용한다.
  • 실제 피에드레이티드 학습 작업에서 경험적으로 방법을 평가하여, 서버 측에서만 적응성을 사용하거나 SGD를 사용하는 기준 방법과의 수렴 속도 및 테스트 정확도를 비교한다.

실험 결과

연구 질문

  • RQ1피에드레이티드 학습에서 국소 적응형 최적화 방법(예: AdaGrad)을 사용할 경우, 표준 SGD 대비 수렴 속도가 빨라지는가?
  • RQ2국소 적응형 최적화기를 사용할 경우, 수렴한 모델이 전역 목표의 정적점과 다를 수 있는 비소거적 해법 편향이 발생하는가?
  • RQ3상태 기반 국소 최적화기를 사용할 경우, 통신 라운드 간 최적화기 상태의 불연속성 문제를 어떻게 해결할 수 있는가?
  • RQ4보정 기법을 통해 국소 적응성의 이점을 유지하면서도 전역 목표와의 일관성을 복원할 수 있는가?
  • RQ5실제 피에드레이티드 학습 환경에서 제안된 방법이 기존 기준 방법보다 더 빠른 수렴 속도와 높은 테스트 정확도를 달성하는가?

주요 결과

  • AdaGrad와 같은 국소 적응형 방법은 국소 최적화 경로의 조건수를 개선함으로써 피에드레이티드 학습에서 수렴 속도를 크게 가속화한다.
  • 순수하게 국소 적응형 최적화기를 사용할 경우, 최종 모델이 전역 목표의 정적점에서 벗어나는 비소거적 해법 편향이 발생한다.
  • 제안된 상태 재시작 메커니즘은 라운드 간 최적화기 상태의 불연속성을 효과적으로 해결하여 국소 적응형 방법의 안정적 사용을 가능하게 한다.
  • 보정 기법은 국소 적응성의 이점을 유지하면서도 전역 목표와의 일관성을 성공적으로 복원한다.
  • 실제 피에드레이티드 작업에서의 실험 결과, 제안된 방법은 서버 측에서만 적응성을 사용하거나 순수한 SGD를 사용하는 기준 방법보다 더 빠른 수렴 속도와 높은 테스트 정확도를 달성한다.
  • 이론적 분석을 통해 국소 적응성이 고정점 연산자 $\mathbb{E}[\mathcal{A}]$ 를 변화시키며, 보정이 전역 최소값과의 일치를 위해 필수적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.