Skip to main content
QUICK REVIEW

[논문 리뷰] Device Scheduling with Fast Convergence for Wireless Federated Learning

Wenqi Shi, Sheng Zhou|arXiv (Cornell University)|2019. 11. 03.
Privacy-Preserving Technologies in Data참고 문헌 5인용 수 12
한 줄 요약

이 논문은 시간 제약 조건 하에서 수렴 속도를 향상시키기 위해 무선 피어드러닝을 위한 병렬 대역폭 할당 및 장치 스케줄링 정책을 제안한다. 라운드당 지연 시간과 학습 효율성을 동시에 최적화함으로써, 탐욕적 스케줄링 정책은 최상위 기준 대비 최대 14.8% 높은 모델 정확도를 450초의 학습 예산 내에서 달성한다.

ABSTRACT

Owing to the increasing need for massive data analysis and model training at the network edge, as well as the rising concerns about the data privacy, a new distributed training framework called federated learning (FL) has emerged. In each iteration of FL (called round), the edge devices update local models based on their own data and contribute to the global training by uploading the model updates via wireless channels. Due to the limited spectrum resources, only a portion of the devices can be scheduled in each round. While most of the existing work on scheduling focuses on the convergence of FL w.r.t. rounds, the convergence performance under a total training time budget is not yet explored. In this paper, a joint bandwidth allocation and scheduling problem is formulated to capture the long-term convergence performance of FL, and is solved by being decoupled into two sub-problems. For the bandwidth allocation sub-problem, the derived optimal solution suggests to allocate more bandwidth to the devices with worse channel conditions or weaker computation capabilities. For the device scheduling sub-problem, by revealing the trade-off between the number of rounds required to attain a certain model accuracy and the latency per round, a greedy policy is inspired, that continuously selects the device that consumes the least time in model updating until achieving a good trade-off between the learning efficiency and latency per round. The experiments show that the proposed policy outperforms other state-of-the-art scheduling policies, with the best achievable model accuracy under training time budgets.

연구 동기 및 목표

  • 총 학습 시간 예산 하에서 수렴 성능을 고려하지 않고 라운드 수만을 기준으로 삼는 무선 피어드러닝(FL) 연구의 격차를 메우기 위해.
  • 목표 모델 정확도에 도달하는 데 소요되는 예상 시간을 최소화하기 위해 병렬 대역폭 할당 및 장치 스케줄링 문제를 수립하기 위해.
  • 동적인 무선 환경에서 학습 효율성과 라운드당 지연 시간을 균형 잡는 스케줄링 정책을 설계하기 위해.
  • 실제 세계의 시간 제약 조건 하에서 기존 스케줄링 전략에 비해 수렴 속도와 최종 모델 정확도를 향상시키기 위해.

제안 방법

  • 병렬 최적화 문제를 두 개의 하위 문제로 분해: 대역폭 할당 및 장치 스케줄링.
  • 채널 조건이 열악하거나 계산 능력이 떨어지는 장치를 우선순위로 삼는 최적의 대역폭 할당 정책 유도.
  • 최소 업데이트 시간 기반으로 장치를 선택하는 탐욕적 스케줄링 정책 제안: 라운드당 스케줄링 가능한 장치 수를 최대화하면서 지연 시간을 최소화.
  • 주어진 스케줄링 장치 집합에 대해 대역폭 할당 하위 문제를 수치적으로 해결하기 위해 이진 탐색 사용.
  • 대역폭 할당 및 스케줄링 결정을 통합하여 시간 제약 조건 하에서 수렴 속도를 공동 최적화.
  • 실시간 채널 및 계산 조건을 기반으로 장치 선택을 지속적으로 재평가함으로써 동적 환경에 적응하도록 정책 수정.

실험 결과

연구 질문

  • RQ1고정된 총 학습 시간 예산 하에서 무선 피어드러닝의 장치 스케줄링은 어떻게 최적화할 수 있는가?
  • RQ2라운드당 스케줄링 장치 수와 라운드당 지연 시간 사이의 상충 관계는 무엇이며, 최적 성능을 달성하기 위해 어떻게 균형을 이룰 수 있는가?
  • RQ3병렬 대역폭 할당은 무선 FL 시스템에서 수렴 시간과 최종 모델 정확도에 어떤 영향을 미치는가?
  • RQ4시간 제약 조건 하에서 제안된 정책은 기존 스케줄링 기준(예: 랜덤, 비례 공정, 시간 임계값 기반)에 비해 모델 정확도 측면에서 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ5셀 반경 및 장치 이질성과 같은 네트워크 조건의 변화에 따라 제안된 정책의 성능은 어떻게 변하는가?

주요 결과

  • 제안된 스케줄링 정책은 450초의 학습 시간 내에 테스트 정확도 89.85%를 달성하여, Random-opt(75.05%), CL-low(82.38%), CL-high(87.50%), PF(86.57%)에 비해 각각 14.8%, 7.47%, 2.35%, 3.28% 높은 성능을 보였다.
  • 라운드당 평균 지연 시간을 12.07초로 줄였으며, 라운드당 평균 8.31개의 장치를 스케줄링하여 학습 효율성과 지연 시간 사이의 균형을 더 잘 달성했다.
  • CL-high는 수렴 속도를 우선시하지만 지연 시간을 고려하지 않는 반면, 제안된 정책는 80% 정확도에 도달하는 데 53초 빠르게(171초 대비 224초) 도달했다.
  • 성능 우월성은 통신 지연이 지배적인 더 큰 셀 반경(예: 1400m)에서 가장 두드러지며, 셀 반경이 감소함에 따라 지연 시간의 차이가 줄어들어 성능 우위가 점차 감소한다.
  • 제안된 정책는 다양한 네트워크 조건에 잘 적응하며, 다양한 셀 반경에서 기준 정책보다 일관되게 높은 정확도를 유지한다.
  • 대역폭 할당 전략은 채널 품질가 낮거나 계산 능력이 떨어지는 장치에게 더 많은 스펙트럼을 할당하여 공정성과 수렴 효율성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.