[논문 리뷰] Achieving Linear Speedup with Partial Worker Participation in Non-IID Federated Learning
이 논문은 두-sided 학습률을 가진 FedAvg가 비 IID 데이터와 부분적인 작업자 참여하에서 선형 수렴 속도 향상을 달성함을 증명하며, 적절히 조정될 때 로컬 스텝이 T/m까지 가능하여 수렴에 도움을 준다.
Federated learning (FL) is a distributed machine learning architecture that leverages a large number of workers to jointly learn a model with decentralized data. FL has received increasing attention in recent years thanks to its data privacy protection, communication efficiency and a linear speedup for convergence in training (i.e., convergence performance increases linearly with respect to the number of workers). However, existing studies on linear speedup for convergence are only limited to the assumptions of i.i.d. datasets across workers and/or full worker participation, both of which rarely hold in practice. So far, it remains an open question whether or not the linear speedup for convergence is achievable under non-i.i.d. datasets with partial worker participation in FL. In this paper, we show that the answer is affirmative. Specifically, we show that the federated averaging (FedAvg) algorithm (with two-sided learning rates) on non-i.i.d. datasets in non-convex settings achieves a convergence rate $\\mathcal{O}(\\frac{1}{\\sqrt{mKT}} + \\frac{1}{T})$ for full worker participation and a convergence rate $\\mathcal{O}(\\frac{\\sqrt{K}}{\\sqrt{nT}} + \\frac{1}{T})$ for partial worker participation, where $K$ is the number of local steps, $T$ is the number of total communication rounds, $m$ is the total worker number and $n$ is the worker number in one communication round if for partial worker participation. Our results also reveal that the local steps in FL could help the convergence and show that the maximum number of local steps can be improved to $T/m$ in full worker participation. We conduct extensive experiments on MNIST and CIFAR-10 to verify our theoretical results.
연구 동기 및 목표
- 데이터가 작업자 간에 비동일하게 분포(non-IID)되고 작업자들이 부분적으로 참여할 수 있는 연합학습을 동기화한다.
- 비 IID 설정에서 두-sided 학습률을 가지는 FedAvg의 수렴 거동을 분석한다.
- 부분 참여하에서 작업자 수에 따른 선형 속도향상이 달성 가능한지 판단한다.
- 로컬 업데이트 스텝 K가 수렴성과 통신 효율성에 미치는 영향을 정량화한다.
제안 방법
- 참여하는 각 작업자가 로컬 학습률을 가진 K개의 로컬 SGD 스텝을 수행하고 서버가 모델 업데이트를 위해 별도의 전역 학습률을 사용하는 일반화된 FedAvg를 연구한다.
- 데이터 이질성을 모델링하기 위해 리프시츠 연속 그래디언트, 편향되지 않은 로컬 그래디언트 추정치, 그리고 로컬/글로벌 분산의 상한 등을 가정한다.
- 비볼록 설정에서 전체 참여와 부분 참여 모두에 대한 수렴 경계(bounds)를 도출한다.
- 적절한 두-sided 학습률이 전체 참여에서 O(1/√(mKT) + 1/T), 부분 참여에서 O(√K/√(nT) + 1/T)의 수렴 속도를 보임을 보인다.
- 최대 허용 로컬 업데이트를 K ≤ T/m까지 증가시켜 선형 속도향상을 유지할 수 있으며, 적절한 매개변수 선택으로 로컬 스텝이 유익할 수 있음을 보여준다.
- 다양한 모델에서 MNIST와 CIFAR-10에 대한 실험으로 이론적 결과를 검증한다.
실험 결과
연구 질문
- RQ1각 라운드에 일부만 참여하는 경우 비 IID 데이터가 있는 연합학습에서 선형 속도향상을 달성할 수 있는가?
- RQ2두-sided 학습률(다른 로컬과 서버 학습률)이 비 IID 데이터와 부분 참여 하에서 수렴에 어떤 영향을 미치는가?
- RQ3비 IID 연합학습에서 로컬 업데이트 수 K, 전체 라운드 수 T, 그리고 달성된 수렴 속도 사이의 관계는 무엇인가?
- RQ4로컬 업데이트 스텝이 비 IID 데이터 하에서 수렴에 도움을 주는가 아니면 방해하는가, 그리고 K가 T/m까지 유익한 조건은 무엇인가?
주요 결과
- 비볼록 문제에서 비 IID 데이터일 때, 두-sided 학습률을 가지는 FedAvg는 전체 참여에서 O(1/√(mKT) + 1/T), 부분 참여에서 O(√K/√(nT) + 1/T)의 수렴 속도를 달성하여 큰 T에 대해 선형 속도향상을 시사한다.
- 최대 허용 로컬 업데이트를 K ≤ T/m까지 증가시켜 선형 속도향상을 유지할 수 있으며, 라운드를 줄여 통신 효율을 향상시킨다.
- 경사도가 한정된 가정 없이도, 두-sided 학습률 접근 방식이 분산 항을 제어하고 바람직한 수렴 동작을 달성함을 보인다.
- 로컬 업데이트(K가 큰 경우)가 적절한 학습률 스케줄링과 함께 수렴에 도움이 될 수 있으며, 비 IID FL에서 로컬 스텝이 성능에 해를 끼친다는 일부 선행 연구와 대조적이다.
- MNIST와 CIFAR-10에 대한 실험은 이론 속도를 뒷받침하고, 비 IID성, 참여 노동자 수, 로컬 스텝이 수렴 및 정확도에 미치는 영향을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.