Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Gradient Sparsification for Efficient Federated Learning: An Online Learning Approach

Pengchao Han, Shiqiang Wang|arXiv (Cornell University)|2020. 01. 14.
Privacy-Preserving Technologies in Data참고 문헌 42인용 수 9
한 줄 요약

이 논문은 비정규 분포 데이터와 이질적인 클라이언트 자원 조건 하에서 페더레이티드 러닝을 위한 적응형 기울기 희소화 방법을 제안한다. 온라인 학습을 통해 동적으로 희소성 수준을 조정함으로써 학습 시간을 최소화한다. 기울기 부호를 추정하고, 손실 최소화 알고리즘을 사용함으로써 기준 방법 대비 최대 40% 높은 모델 정확도를 달성하며, 비정규 분포 데이터 및 다양한 클라이언트 자원 조건에서 특히 효과적이다.

ABSTRACT

Federated learning (FL) is an emerging technique for training machine learning models using geographically dispersed data collected by local entities. It includes local computation and synchronization steps. To reduce the communication overhead and improve the overall efficiency of FL, gradient sparsification (GS) can be applied, where instead of the full gradient, only a small subset of important elements of the gradient is communicated. Existing work on GS uses a fixed degree of gradient sparsity for i.i.d.-distributed data within a datacenter. In this paper, we consider adaptive degree of sparsity and non-i.i.d. local datasets. We first present a fairness-aware GS method which ensures that different clients provide a similar amount of updates. Then, with the goal of minimizing the overall training time, we propose a novel online learning formulation and algorithm for automatically determining the near-optimal communication and computation trade-off that is controlled by the degree of gradient sparsity. The online learning algorithm uses an estimated sign of the derivative of the objective function, which gives a regret bound that is asymptotically equal to the case where exact derivative is available. Experiments with real datasets confirm the benefits of our proposed approaches, showing up to $40\%$ improvement in model accuracy for a finite training time.

연구 동기 및 목표

  • 비정규 분포 데이터와 이질적인 클라이언트 자원 조건 하에서 기울기 희소화의 고정된 희소성으로 인한 비효율성을 해결하기 위해.
  • 적응형 희소성 선택을 통해 통신과 계산 간의 균형을 동적으로 유지함으로써 총 학습 시간을 최소화하기 위해.
  • 상행 및 하행 경로에서의 양방향 최상위-k 기울기 선택을 통해 클라이언트 기여도의 공정성을 확보하기 위해.
  • 기울기 부호를 추정하는 데 유용한 증명 가능하게 효율적인 온라인 학습 알고리즘을 개발하여 최적의 희소성 제어를 가능하게 하기 위해.
  • 실세계 데이터셋에서 방법을 검증하고 수렴성 및 정확도 향상을 입증하기 위해.

제안 방법

  • 모든 클라이언트에서 동일한 k 요소를 사용하여 상행 및 하행 기울기를 모두 희소화하는 공정성 인식 양방향 최상위-k 기울기 희소화(FAB-top-k)를 도입한다.
  • 기울기 부호 추정과 클라이언트별 트레이드오프를 바탕으로 최적의 희소성 수준 k를 적응적으로 선택하는 온라인 학습 프레임워크를 제안한다.
  • 손실 한계 분석을 통해 알고리즘의 성능이 정확한 기울기 도함수를 사용하는 오라클과 점점 가까워짐을 보여준다.
  • 수렴성과 유한한 손실을 보장하기 위해 감소하는 스텝 크기 δₘ = B/√(2m)를 사용하는 투영된 부분기울기 업데이트 규칙을 적용한다.
  • 볼록성과 부분기울기 성질을 활용해 손실에 대한 이론적 경계를 유도하며, 점점 최적에 수렴함을 보여준다.
  • 클라이언트 측 공정성 제약 조건을 통합하여 느린 또는 능력이 떨어지는 클라이언트의 활용도 저하를 방지한다.

실험 결과

연구 질문

  • RQ1페더레이티드 러닝에서 다양한 클라이언트의 계산 및 통신 능력에 맞게 기울기 희소화를 어떻게 적응적으로 조정할 수 있는가?
  • RQ2비정규 분포 페더레이티드 러닝 환경에서 학습 시간을 최소화하기 위해 최적의 희소성 정도는 무엇인가?
  • RQ3기울기 부호 추정을 사용한 온라인 학습이 동적 희소성 선택에서 거의 최적의 성능을 달성할 수 있는가?
  • RQ4양방향 기울기 희소화(상행 및 하행)는 클라이언트 간 수렴성과 공정성에 어떤 영향을 미치는가?
  • RQ5적응형 희소성은 실세계 데이터셋에서 모델 정확도와 학습 효율성 향상에 측정 가능한 기여를 하는가?

주요 결과

  • 제안된 적응형 기울기 희소화 방법은 유한한 학습 시간 내에 고정 희소성 기반 방법 대비 최대 40% 높은 모델 정확도를 달성한다.
  • 기울기 부호 추정을 사용한 온라인 학습 알고리즘은 정확한 기울기 도함수를 사용할 경우와 점점 유사한 손실 한계를 달성한다.
  • 공정성 인식 FAB-top-k 메커니즘은 균형 잡힌 클라이언트 기여를 보장하여 이질적인 클라이언트 간 수렴 안정성을 향상시킨다.
  • 이론적 분석을 통해 손실이 O(√M) 비율로 증가함을 확인하였으며, 이는 유한한 부분기울기 조건 하에서 온라인 볼록 최적화의 최적 속도와 일치한다.
  • 실세계 데이터셋에서의 실험 결과는 통신 오버헤드를 줄이면서도 모델 성능을 유지하거나 향상시킴으로써 방법의 효과성을 입증한다.
  • 비정규 분포 데이터 환경과 변동성이 큰 네트워크 조건 하에서 FedAvg 및 고정-k GS 방법보다 우수한 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.