[논문 리뷰] FedPAGE: A Fast Local Stochastic Gradient Method for Communication-Efficient Federated Learning
FedPAGE는 FedAvg에서 표준 국소 SGD를 최적의 PAGE 확률적 경사하강법으로 대체함으로써 통신 효율성을 높인 분산학습 알고리즘을 제안한다. 이로 인해 볼록 문제에 대해 $O(N^{3/4}/(S\epsilon))$ 및 비볼록 문제에 대해 $O((\sqrt{N}+S)/(S\epsilon^2))$의 최신 기술 수준 통신 복잡도를 달성하며, 일반적인 클라이언트 샘플링 설정 하에서 SCAFFOLD에 비해 각각 $N^{1/4}$ 및 $N^{1/6}S^{1/3}$의 요소로 향상된다.
Federated Averaging (FedAvg, also known as Local-SGD) (McMahan et al., 2017) is a classical federated learning algorithm in which clients run multiple local SGD steps before communicating their update to an orchestrating server. We propose a new federated learning algorithm, FedPAGE, able to further reduce the communication complexity by utilizing the recent optimal PAGE method (Li et al., 2021) instead of plain SGD in FedAvg. We show that FedPAGE uses much fewer communication rounds than previous local methods for both federated convex and nonconvex optimization. Concretely, 1) in the convex setting, the number of communication rounds of FedPAGE is $O(\frac{N^{3/4}}{Sε})$, improving the best-known result $O(\frac{N}{Sε})$ of SCAFFOLD (Karimireddy et al.,2020) by a factor of $N^{1/4}$, where $N$ is the total number of clients (usually is very large in federated learning), $S$ is the sampled subset of clients in each communication round, and $ε$ is the target error; 2) in the nonconvex setting, the number of communication rounds of FedPAGE is $O(\frac{\sqrt{N}+S}{Sε^2})$, improving the best-known result $O(\frac{N^{2/3}}{S^{2/3}ε^2})$ of SCAFFOLD (Karimireddy et al.,2020) by a factor of $N^{1/6}S^{1/3}$, if the sampled clients $S\leq \sqrt{N}$. Note that in both settings, the communication cost for each round is the same for both FedPAGE and SCAFFOLD. As a result, FedPAGE achieves new state-of-the-art results in terms of communication complexity for both federated convex and nonconvex optimization.
연구 동기 및 목표
- 표준 FedAvg 알고리즘을 개선하여 분산학습의 통신 복잡도를 감소시키는 것.
- 이질적이고 지리적으로 분산된 클라이언트 간의 탈중앙형, 개인정보 보호 중심 학습에서의 통신 병목 현상을 해결하는 것.
- 모델 정확도를 유지하면서도 볼록 및 비볼록 최적화 설정 모두에서 더 적은 통신 라운드 수로 더 빠른 수렴을 달성하는 것.
- 국소 업데이트에 최적의 PAGE 방법을 활용하여 이전의 국소 방법들(예: SCAFFOLD)보다 더 나은 수렴 속도를 달성하는 것.
제안 방법
- FedAvg의 국소 SGD 단계를 수렴 효율성을 향상시키기 위해 PAGE(오차 보정이 있는 프락시얼 가속 경사하강법) 방법으로 대체한다.
- 변동성 감소 경사 추정과 적응형 스텝 사이즈를 조합한 하이브리드 국소 업데이트 전략을 사용하여 노이즈를 줄이고 수렴 속도를 가속화한다.
- 통신 비용과 모델 정확도를 균형 잡기 위해 라운드당 $S$개의 클라이언트를 샘플링하는 전략을 적용하며, 이때 $S \leq \sqrt{N}$은 실무에서 일반적인 설정이다.
- 부드러움과 유한한 변동성 가정 하에 엄밀한 통신 복잡도 한계를 유도하기 위해 새로운 분석 프레임워크를 도입한다.
- 전역 및 국소 업데이트에 각각 최적의 스텝 사이즈 $\eta_g$와 $\eta_l$를 유도하여 통신 라운드 수를 최소화한다.
- 예상 부분최적성과 경사 노름을 유 bounds하기 위해 리아푸노프 스타일 분석을 적용함으로써 볼록 및 비볼록 설정 모두에서 수렴 보장을 가능하게 한다.
실험 결과
연구 질문
- RQ1국소 SGD를 더 고급 확률적 경사하강법으로 대체함으로써 FedAvg의 통신 복잡도를 크게 감소시킬 수 있는가?
- RQ2볼록 및 비볼록 문제 모두에서 FedPAGE의 성능은 SCAFFOLD에 비해 통신 라운드 수 측면에서 어떻게 비교되는가?
- RQ3표준 부드러움 및 유한한 변동성 가정 하에서 FedPAGE의 이론적 통신 복잡도는 무엇인가?
- RQ4작은 클라이언트 부분집합($S \ll N$)만을 라운드당 샘플링할 경우 FedPAGE는 여전히 그 이점을 유지하는가?
- RQ5대규모 분산학습 환경에서 FedPAGE는 더 적은 통신 라운드 수로 더 빠른 수렴을 달성하면서도 모델 정확도를 유지할 수 있는가?
주요 결과
- 볼록 설정에서 FedPAGE는 $O(N^{3/4}/(S\epsilon))$의 통신 복잡도를 달성하며, SCAFFOLD의 $O(N/(S\epsilon))$에 비해 $N^{1/4}$의 요소로 향상된다.
- 비볼록 설정에서 FedPAGE는 통신 라운드 수를 $O((\sqrt{N}+S)/(S\epsilon^2))$로 줄였으며, $S \leq \sqrt{N}$일 경우 SCAFFOLD의 $O(N^{2/3}/(S^{2/3}\epsilon^2))$에 비해 $N^{1/6}S^{1/3}$의 요소로 향상된다.
- SCAFFOLD와 동일한 라운드당 통신 비용을 유지하므로, FedPAGE는 통신 부담을 늘리지 않고도 더 뛰어난 성능을 달성한다.
- FedPAGE는 실무에서 흔한 유한한 변동성(BV) 가정 하에서도 이론적 이점을 유지한다.
- FedPAGE는 볼록 및 비볼록 문제 모두에서 통신 복잡도 측면에서 최적의 수렴 속도를 달성하여 새로운 최신 기술 수준을 확립한다.
- 클라이언트 샘플링에 대해 강건하며, 실생활 분산학습에서 일반적인 설정인 라운드당 작은 부분집합 $S$만 선택되더라도 잘 작동한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.