Skip to main content
QUICK REVIEW

[논문 리뷰] Server Averaging for Federated Learning

George Pu, Yanlin Zhou|arXiv (Cornell University)|2021. 03. 22.
Privacy-Preserving Technologies in Data참고 문헌 16인용 수 4
한 줄 요약

이 논문은 서버 평균화를 제안하며, 이는 글로벌 모델을 다수의 과거 글로벌 모델에서 주기적으로 평균화하여 수렴 속도를 향상시키는 방식이다. 실험 결과, 특히 비독립 동일 분포(non-IID) 데이터에서 FedAvg보다 목표 정확도에 더 빨리 도달하며, 에포크 감소 기법을 통해 클라이언트의 계산량을 최대 40% 줄여 성능 저하 없이도 효율성을 확보한다.

ABSTRACT

Federated learning allows distributed devices to collectively train a model without sharing or disclosing the local dataset with a central server. The global model is optimized by training and averaging the model parameters of all local participants. However, the improved privacy of federated learning also introduces challenges including higher computation and communication costs. In particular, federated learning converges slower than centralized training. We propose the server averaging algorithm to accelerate convergence. Sever averaging constructs the shared global model by periodically averaging a set of previous global models. Our experiments indicate that server averaging not only converges faster, to a target accuracy, than federated averaging (FedAvg), but also reduces the computation costs on the client-level through epoch decay.

연구 동기 및 목표

  • 비독립 동일 분포 데이터 분포에서의 느린 수렴 문제를 해결하기 위해.
  • 모델 성능 저하 없이 클라이언트 측 계산 비용을 줄이기 위해.
  • 서버 측 평균화를 통해 과거 글로벌 모델 상태를 활용하여 수렴 속도와 일반화 성능을 향상시키기 위해.
  • 에포크 감소 기법이 클라이언트 수준의 계산 제어 메커니즘으로서의 효과성을 탐색하기 위해.

제안 방법

  • 서버 평균화는 슬라이딩 윈도우 크기 P를 사용해 과거 P개의 글로벌 모델을 평균화하여 새로운 글로벌 모델를 주기적으로 계산한다.
  • 평균화는 R개의 통신 라운드마다 수행되며, 공식 $ w^t \text{←} \sum_{i=0}^{P-1} w^{t-i} $ 를 통해 최근 글로벌 모델들의 가중 평균을 생성한다.
  • 에포크 감소는 시간이 지남에 따라 로컬 학습 에포크 수를 줄이며, 초기값 E에서 시작하여 매 D라운드마다 반으로 줄어든다: $ E_t = \max(E / 2^{\lfloor t/D \rfloor}, 1) $.
  • 이 방법은 비독립 동일 분포 피에드러티드 MNIST에 적용되어, 90%, 95%, 97%, 98% 정확도 기준으로 FedAvg와 비교 평가되었다.
  • 이 기법은 반복 평균화 원리에 기반하여 학습을 안정화하고 일반화 성능을 향상시키며, Stochastic Weight Averaging(SWA)와 유사하다.
  • 이 기법은 통신 및 계산 효율성을 고려하여 설계되었으며, 추가로 전송이 필요한 기울기 또는 모멘터드 항목이 필요하지 않다.

실험 결과

연구 질문

  • RQ1서버 측에서 과거 글로벌 모델을 주기적으로 평균화하는 것이 FedAvg에 비해 피에드러티드 학습의 수렴 속도를 가속화하는가?
  • RQ2비독립 동일 분포 데이터 분포 하에서 서버 평균화가 수렴 속도와 모델 정확도에 어떤 영향을 미치는가?
  • RQ3에포크 감소 기법이 계산 비용을 줄이면서도 수렴 성능을 유지하거나 향상시킬 수 있는가?
  • RQ4서버 평균화와 에포크 감소를 병합하면 수렴 속도와 계산 비용 간의 더 나은 트레이드오프를 달성할 수 있는가?
  • RQ5수렴성과 통신 효율성 측면에서 서버 평균화의 성능이 SCAFFOLD나 FedProx와 같은 최신 기법들과 비교해 어떻게 되는가?

주요 결과

  • P=2, R=40일 때 서버 평균화로 90% 정확도에 도달하는 데 소요된 라운드 수가 FedAvg(36.40 라운드) 대비 23% 감소한 28.00 라운드를 기록했다.
  • 95% 정확도에 대해선 최적 설정(P=3, R=40)이 76.20 라운드를 기록하여 FedAvg의 85.40 라운드 대비 11.5% 향상된 성능을 보였다.
  • 모든 정확도 기준에서 더 빠른 수렴을 달성했으며, 특히 90% 및 95% 정확도에서 가장 두드러진 성과를 보였다.
  • 에포크 감소로 클라이언트 계산량을 최대 40%까지 줄일 수 있었으며, 최적 감소 비율(D=200)은 90% 정확도에 도달하는 데 27.20 라운드를 기록하여 FedAvg 대비 25% 향상된 성능을 보였다.
  • 계산량이 감소함에도 불구하고 에포크 감소 기법은 경쟁 가능한 성능을 유지했으며, 높은 정확도 기준에 도달하는 데 필요한 라운드 수는 소량 증가에 그쳤다.
  • 서버 평균화와 에포크 감소의 조합은 수렴 속도를 향상시키면서도 클라이언트 계산량을 줄여, 속도와 비용 간의 유리한 트레이드오프를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.