Skip to main content
QUICK REVIEW

[논문 리뷰] Fast-Convergent Federated Learning with Adaptive Weighting

Hongda Wu, Ping Wang|arXiv (Cornell University)|2020. 12. 01.
Privacy-Preserving Technologies in Data참고 문헌 22인용 수 8
한 줄 요약

이 논문은 지역 기울기와 전역 기울기 간의 각도를 기반으로 참가 노드의 기여도를 적응적으로 가중하는 빠른 수렴 성능을 보이는 페더레이티드 러닝 알고리즘 FedAdp를 제안한다. 이 각도에 비선형 매핑을 적용함으로써, 부정적인 기여도는 동적으로 억제하고 긍정적인 기여도는 증폭시켜, FedAvg에 비해 MNIST에서 최대 54.1% 감소하고 FashionMNIST에서 최대 45.4% 감소한 통신 라운드를 달성한다.

ABSTRACT

Federated learning (FL) enables resource-constrained edge nodes to collaboratively learn a global model under the orchestration of a central server while keeping privacy-sensitive data locally. The non-independent-and-identically-distributed (non-IID) data samples across participating nodes slow model training and impose additional communication rounds for FL to converge. In this paper, we propose Federated Adaptive Weighting (FedAdp) algorithm that aims to accelerate model convergence under the presence of nodes with non-IID dataset. We observe the implicit connection between the node contribution to the global model aggregation and data distribution on the local node through theoretical and empirical analysis. We then propose to assign different weights for updating the global model based on node contribution adaptively through each training round. The contribution of participating nodes is first measured by the angle between the local gradient vector and the global gradient vector, and then, weight is quantified by a designed non-linear mapping function subsequently. The simple yet effective strategy can reinforce positive (suppress negative) node contribution dynamically, resulting in communication round reduction drastically. Its superiority over the commonly adopted Federated Averaging (FedAvg) is verified both theoretically and experimentally. With extensive experiments performed in Pytorch and PySyft, we show that FL training with FedAdp can reduce the number of communication rounds by up to 54.1% on MNIST dataset and up to 45.4% on FashionMNIST dataset, as compared to FedAvg algorithm.

연구 동기 및 목표

  • 에지 노드 간의 비독립 동일분포(non-IID) 데이터 분포에서 페더레이티드 러닝의 느린 수렴 문제를 해결한다.
  • 모든 노드에 동일한 가중치를 할당하는 FedAvg의 한계를 극복하여, 노드 기여도에 관계없이 수렴이 최적화되지 않는 문제를 해결한다.
  • 통신 효율성을 향상시키기 위해 동적이고 기여도 인식 가중 전략을 개발한다.
  • 이론적 및 실증적으로 노드 기여도가 기울기 일치도와 관련이 있으며, 이를 통해 수렴 속도를 가속화할 수 있음을 검증한다.

제안 방법

  • 각 훈련 라운드에서 지역 기울기 벡터와 전역 기울기 벡터 간의 코사인 값을 사용해 노드 기여도를 측정한다.
  • 각도 기반 기여도 점수를 비선형 매핑 함수를 적용하여 각 노드의 동적 가중치로 변환한다.
  • 계산된 기여도 점수 비례로 가중 평균을 사용해 전역 모델을 업데이트한다.
  • 비선형 함수에 있는 조정 가능한 파라미터 α를 사용해 고기여도 및 저기여도 노드 간의 차이를 증폭시키는 것을 제어한다.
  • 모델 아키텍처를 수정하지 않고 표준 페더레이티드 평균 프레임워크에 적응적 가중 전략을 통합한다.
  • IID 및 비-IID 노드가 혼합된 경우를 포함해 다양한 데이터 이질성 수준에서 방법을 평가한다.

실험 결과

연구 질문

  • RQ1데이터 이질성(non-IID 분포)은 페더레이티드 러닝의 수렴 속도에 어떤 영향을 미치는가?
  • RQ2지역 데이터 분포와 노드가 전역 모델 집계에 기여하는 정도 사이에 암묵적인 관계는 무엇인가?
  • RQ3기울기 일치도를 기반으로 한 적응적 가중치가 FL에서 수렴 속도를 향상시키고 통신 라운드를 감소시키는 데 효과적인가?
  • RQ4비선형 매핑 파라미터 α의 선택은 적응적 가중 전략의 성능에 어떤 영향을 미치는가?
  • RQ5제안된 방법은 FedAvg에 비해 모델 분산과 훈련 손실을 얼마나 줄이는가?

주요 결과

  • FedAdp는 비-IID 데이터 설정 하에서 MNIST 데이터셋에서 FedAvg에 비해 통신 라운드를 최대 54.1% 감소시킨다.
  • FashionMNIST 데이터셋에서 FedAdp는 FedAvg에 비해 통신 라운드를 최대 45.4% 감소시킨다.
  • 높은 데이터 왜곡이 있는 50%의 IID 노드와 50%의 비-IID 노드가 혼합된 상황에서도 제안된 방법은 더 빠른 수렴을 달성한다.
  • 비선형 매핑 파라미터 α를 증가시킴으로써 초기 훈련 단계에서 노드 기여도의 차이를 증폭시켜 수렴 속도를 향상시킬 수 있다.
  • 실증 결과에 따르면 FedAdp가 노드 간 기울기 분산을 감소시켜, 낮은 훈련 손실과 더 빠른 수렴과 관련이 있음을 보여준다.
  • 적응적 가중 전략은 정규화 메커니즘으로 작용하여 왜곡된 데이터로 훈련된 국소 모델이 전역 방향에서 크게 벗어나지 않도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.