Skip to main content
QUICK REVIEW

[논문 리뷰] FedLGA: Towards System-Heterogeneity of Federated Learning via Local Gradient Approximation

Xingyu Li, Zhe Qu|arXiv (Cornell University)|2021. 12. 22.
Privacy-Preserving Technologies in Data참고 문헌 61인용 수 5
한 줄 요약

FedLGA는 계산 능력이 다른 기기들로부터 부족한 국소 업데이트를 사용하여 집계기에서 전체 국소 기울기를 근사함으로써 시스템 이질성 문제를 해결하는 새로운 분산 학습 알고리즘을 제안한다. 단순 선형 계산 오버헤드를 가진 교대 헤시안 추정 방법을 활용함으로써, 전체 참가 시에는 $\mathcal{O}\left(\frac{(1+\rho)}{\sqrt{NT}} + \frac{1}{T}\right)$, 부분 참가 시에는 $\mathcal{O}\left(\frac{(1+\rho)\sqrt{E}}{\sqrt{TK}} + \frac{1}{T}\right)$ 의 수렴 속도를 달성하며, 비독립 동일 분포(non-iid) 데이터와 이질적 기기 환경에서 기존 방법들을 능가한다.

ABSTRACT

Federated Learning (FL) is a decentralized machine learning architecture, which leverages a large number of remote devices to learn a joint model with distributed training data. However, the system-heterogeneity is one major challenge in a FL network to achieve robust distributed learning performance, which comes from two aspects: i) device-heterogeneity due to the diverse computational capacity among devices; ii) data-heterogeneity due to the non-identically distributed data across the network. Prior studies addressing the heterogeneous FL issue, e.g., FedProx, lack formalization and it remains an open problem. This work first formalizes the system-heterogeneous FL problem and proposes a new algorithm, called FedLGA, to address this problem by bridging the divergence of local model updates via gradient approximation. To achieve this, FedLGA provides an alternated Hessian estimation method, which only requires extra linear complexity on the aggregator. Theoretically, we show that with a device-heterogeneous ratio $ρ$, FedLGA achieves convergence rates on non-i.i.d. distributed FL training data for the non-convex optimization problems with $\mathcal{O} \left( \frac{(1+ρ)}{\sqrt{ENT}} + \frac{1}{T} ight)$ and $\mathcal{O} \left( \frac{(1+ρ)\sqrt{E}}{\sqrt{TK}} + \frac{1}{T} ight)$ for full and partial device participation respectively, where $E$ is the number of local learning epoch, $T$ is the number of total communication round, $N$ is the total device number and $K$ is the number of selected device in one communication round under partially participation scheme. The results of comprehensive experiments on multiple datasets show that FedLGA outperforms current FL methods against the system-heterogeneity.

연구 동기 및 목표

  • 데이터 이질성과 기기 이질성으로 인한 시스템 이질성 문제를 해결한다.
  • 특히 기기의 계산 능력 차이로 인해 발생하는 국소 업데이트의 불완전성에 기인한 시스템 이질적 분산 학습 문제를 수식화한다.
  • 모든 기기가 완전한 국소 학습 에포크를 완료하지 않아도 수렴 가능하고 안정적인 성능을 확보할 수 있는 방법을 개발한다.
  • 모델 정확도와 수렴 보장을 유지하면서도 원격 기기에서의 계산 오버헤드를 최소화한다.
  • 완전한 및 부분적 기기 참가 방식에서 비볼록 최적화에 대한 이론적 수렴 경계를 제시한다.

제안 방법

  • 계산 능력이 다른 기기들로부터의 불완전한 국소 업데이트를 활용하여 최적 기울기를 근사하는 새로운 분산 학습 알고리즘 FedLGA를 제안한다.
  • 집계기에서 교대 헤시안 추정 방법을 구현하여 기기에서 완전한 국소 학습이 필요 없이 전체 국소 기울기를 근사한다.
  • 부분적 국소 업데이트와 완전한 국소 업데이트 간의 편차를 줄이기 위해 프록시 유사 업데이트 규칙을 도입한다.
  • 추가 계산은 모두 집계기에서 수행되며, 원격 기기에는 추가 비용이 발생하지 않도록 알고리즘을 설계한다.
  • 모델 차원 $d$ 에 대해 각 커뮤니케이션 라운드당 $\mathcal{O}(d)$ 의 추가 비용만 발생시키는 선형 복잡도의 헤시안 근사 기법을 사용하여 효율성을 유지한다.
  • 기기들이 모든 국소 에포크를 완료하지 않아도 기여할 수 있도록 허용하는 최적화 문제를 설정한다.

실험 결과

연구 질문

  • RQ1기기들의 계산 능력 이질성으로 인해 국소 업데이트가 불완전할 경우, 분산 학습 시스템이 수렴할 수 있는가?
  • RQ2이질적 기기들로부터의 부분적 국소 업데이트만을 사용하여 집계기가 전체 국소 기울기를 어떻게 근사할 수 있는가?
  • RQ3부분적 기기 참가 조건 하에서 시스템 이질적 환경에서의 분산 학습 알고리즘의 이론적 수렴 속도는 무엇인가?
  • RQ4제안된 방법은 엣지 기기에서의 통신 및 계산 오버헤드를 최소화하면서도 높은 모델 정확도를 유지할 수 있는가?
  • RQ5비독립 동일 분포 및 이질적 환경에서 기존 방법들인 FedProx, FedAvg, Scaffold 와 비교해 볼 때, 제안된 방법은 수렴성과 내성에 있어 어떻게 우월한가?

주요 결과

  • 전체 기기 참가 조건 하에서 FedLGA는 이론적 수렴 속도 $\mathcal{O}\left(\frac{(1+\rho)}{\sqrt{NT}} + \frac{1}{T}\right)$ 를 달성하며, 여기서 $\rho$ 는 기기 이질성 비율이다.
  • 부분적 참가 조건 하에서는 FedLGA가 $\mathcal{O}\left(\frac{(1+\rho)\sqrt{E}}{\sqrt{TK}} + \frac{1}{T}\right)$ 의 수렴 속도를 확보하며, $E$ 는 국소 에포크 수, $T$ 는 총 라운드 수, $K$ 는 라운드당 선택된 기기 수이다.
  • 다양한 실세계 데이터셋에서 수행된 종합적 실험 결과, FedLGA는 테스트 정확도, 통신 효율성, 총 학습 시간 측면에서 FedProx, FedAvg, Scaffold 를 모두 능가한다.
  • 집계기에서만 선형 계산 오버헤드가 발생하므로, 대규모 분산 학습 시스템에 대해 확장 가능하고 실용적이다.
  • 낮은 계산 능력을 가진 기기들이 부분적 업데이트를 기여하더라도 FedLGA는 높은 성능을 유지하며, 시스템 이질성에 대한 강력한 내성성을 보여준다.
  • FedLGA의 헤시안 근사 방법은 완전한 국소 학습이 필요 없이 정확한 기울기 추정을 가능하게 하여 기기 동기화의 필요성을 줄인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.