Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed Non-Convex Optimization with Sublinear Speedup under Intermittent Client Availability

Yikai Yan, Chaoyue Niu|arXiv (Cornell University)|2020. 02. 18.
Privacy-Preserving Technologies in Data참고 문헌 40인용 수 12
한 줄 요약

이 논문은 간헐적인 클라이언트 가용성 하에서 피어드 페더레이티드 러닝을 위한 분산 비볼록 최적화 알고리즘인 Federated Latest Averaging (FedLaAvg)를 제안한다. 가용한 클라이언트들로부터 최신 기울기를 활용함으로써, 다른 클라이언트가 오프라인일 경우에도 $O(1/N^{1/4})$의 부분선형 수렴 속도를 달성하며, 현실적인 클라이언트 가용성 패턴 하에서 MNIST 및 Sentiment140 데이터셋에서 FedAvg보다 안정성과 일반화 성능이 뛰어나다.

ABSTRACT

Federated learning is a new distributed machine learning framework, where a bunch of heterogeneous clients collaboratively train a model without sharing training data. In this work, we consider a practical and ubiquitous issue when deploying federated learning in mobile environments: intermittent client availability, where the set of eligible clients may change during the training process. Such intermittent client availability would seriously deteriorate the performance of the classical Federated Averaging algorithm (FedAvg for short). Thus, we propose a simple distributed non-convex optimization algorithm, called Federated Latest Averaging (FedLaAvg for short), which leverages the latest gradients of all clients, even when the clients are not available, to jointly update the global model in each iteration. Our theoretical analysis shows that FedLaAvg attains the convergence rate of $O(E^{1/2}/(N^{1/4} T^{1/2}))$, achieving a sublinear speedup with respect to the total number of clients. We implement FedLaAvg along with several baselines and evaluate them over the benchmarking MNIST and Sentiment140 datasets. The evaluation results demonstrate that FedLaAvg achieves more stable training than FedAvg in both convex and non-convex settings and indeed reaches a sublinear speedup.

연구 동기 및 목표

  • 기기의 배터리와 네트워크 제약으로 인해 클라이언트 참여가 시간에 따라 변동하는 크로스디바이스 페더레이티드 러닝 환경에서 간헐적인 클라이언트 가용성 문제를 해결하기 위해.
  • 동적인 클라이언트 가용성과 비IIDs 데이터 분포에도 불구하고 학습 안정성과 수렴성을 유지할 수 있는 실용적인 최적화 알고리즘을 설계하기 위해.
  • 이전 FedAvg 분석에서 강력한 전체 클라이언트 가용성 가정을 완화하고, 부분적이고 시간에 따라 변하는 클라이언트 참여 하에서의 수렴성을 이론적으로 분석하기 위해.
  • 실제 실험을 통해 FedLaAvg가 볼록 및 비볼록 환경 모두에서 FedAvg보다 부분선형 수렴 속도 향상과 더 나은 일반화 성능을 달성하는지 검증하기 위해.

제안 방법

  • FedLaAvg는 현재 라운드에 참여하지 않더라도 모든 클라이언트의 최신 기울기를 유지하고 사용하여 글로벌 모델을 업데이트한다.
  • 알고리즘은 클라이언트의 마지막 업데이트 시간을 기반으로 선택하며, 가장 최근 기울기를 가진 클라이언트를 우선순위로 하여 기울기의 오래됨을 줄인다.
  • 모든 클라이언트의 최신 기울기 평균을 계산하기 위해 기울기 차이 집계 메커니즘을 사용하여 최신 모델 업데이트를 보장한다.
  • 이론적 분석을 통해 $O(E^{1/2}/(N^{1/4}T^{1/2}))$의 수렴 속도를 확립하며, 총 클라이언트 수 $N$에 대해 부분선형 수렴 속도를 보여준다.
  • 클라이언트당 $O(Q)$의 추가 스토리지만 필요로 하여 자원이 제한된 기기에서도 구현이 가능하도록 경량화된 설계를 한다.
  • 클라우드 서버는 클라이언트 가용성 타임스탬프 목록을 유지하고, 매 라운드마다 가장 최근의 $K$개 클라이언트를 선택하여 기울기 오래됨을 최소화한다.

실험 결과

연구 질문

  • RQ1간헐적인 클라이언트 가용성 하에서, 클라이언트가 예측 불가능하게 참가하고 퇴장하는 환경에서 최적화 알고리즘이 안정적인 수렴을 달성할 수 있는가?
  • RQ2비볼록 환경에서 모든 클라이언트의 최신 가용 기울기를 활용할 경우, FedAvg에 비해 수렴성과 일반화 성능이 향상되는가?
  • RQ3시간에 따라 변하는 클라이언트 가용성 하에서 페더레이티드 알고리즘의 이론적 수렴 속도는 무엇이며, 클라이언트 수에 대해 부분선형 수렴 속도를 달성하는가?
  • RQ4실제 데이터셋에서 FedLaAvg의 성능은 FedAvg, FedProx, FedSGD에 비해 테스트 정확도와 학습 안정성 측면에서 어떻게 비교되는가?

주요 결과

  • FedLaAvg는 이론적으로 $O(E^{1/2}/(N^{1/4}T^{1/2}))$의 수렴 속도를 확보하며, 총 클라이언트 수 $N$에 대해 부분선형 수렴 속도를 보여준다.
  • MNIST 데이터셋에서, FedLaAvg는 클라이언트 가용성 변동성과 비IIDs 데이터가 높을수록 FedAvg와 FedProx보다 더 높은 테스트 정확도를 달성한다.
  • Sentiment140 데이터셋에서, FedLaAvg는 라운드당 가용 클라이언트 비율이 낮은 상황에서도 안정적인 학습과 뛰어난 일반화 성능을 유지한다.
  • 클라이언트 수 $N$과 선택 비율 $\beta$에 관계없이 일관된 성능을 보이며, $N$이 증가함에 따라 테스트 정확도가 향상되지만 속도는 점점 감소함을 확인하여 부분선형 수렴 속도를 확인한다.
  • 실증 결과로 FedLaAvg는 간헐적인 가용성으로 인한 데이터 편향의 부정적 영향을 줄여, 훈련 데이터와 테스트 데이터 분포 간의 일치도 향상됨을 보였다.
  • 최소한의 오버헤드만 발생한다: 클라이언트당 $O(Q)$ 스토리지와 서버에서 $O(N+Q)$의 메모리 사용량으로, 모바일 및 엣지 기기에서의 구현에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.