Skip to main content
QUICK REVIEW

[논문 리뷰] On the effectiveness of partial variance reduction in federated learning with heterogeneous data

Bo Li, Mikkel N. Schmidt|arXiv (Cornell University)|2022. 12. 05.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

이 논문은 딥 네ural 네트워크의 최종 분류 레이어에만 분산 감소를 적용하는 부분적 분산 감소 방법인 FedPVR을 제안한다. 마지막 레이어에서만 기울기 분산을 감소시킴으로써, 이는 이질적인 데이터에서 FedAvg 및 기타 베이스라인과 비교해 더 빠른 수렴 속도와 높은 정확도를 달성하면서도 낮은 통신 비용을 유지하며 볼록 및 비볼록 설정 모두에서 수렴성을 입증한다.

ABSTRACT

Data heterogeneity across clients is a key challenge in federated learning. Prior works address this by either aligning client and server models or using control variates to correct client model drift. Although these methods achieve fast convergence in convex or simple non-convex problems, the performance in over-parameterized models such as deep neural networks is lacking. In this paper, we first revisit the widely used FedAvg algorithm in a deep neural network to understand how data heterogeneity influences the gradient updates across the neural network layers. We observe that while the feature extraction layers are learned efficiently by FedAvg, the substantial diversity of the final classification layers across clients impedes the performance. Motivated by this, we propose to correct model drift by variance reduction only on the final layers. We demonstrate that this significantly outperforms existing benchmarks at a similar or lower communication cost. We furthermore provide proof for the convergence rate of our algorithm.

연구 동기 및 목표

  • 딥 네럴 네트워크를 사용하는 비독립 동일 분포(non-IID) 및 이질적인 데이터 설정에서 FedAvg가 성능이 열 劣하는 이유를 조사한다.
  • 신경망의 어떤 레이어가 데이터 이질성과 모델 드리프트에 가장 영향을 받는지 규명한다.
  • 가장 문제가 되는 레이어에만 드리프트 보정을 적용하는 통신 효율적인 피에프드러닝 방법을 설계한다.
  • 볼록 및 비볼록 설정 모두에서 제안된 방법의 수렴성을 증명한다.
  • 부분적 분산 감소가 전체 모델 분산 감소 및 기존 베이스라인 방법보다 정확도와 통신 효율성 면에서 뛰어나다는 것을 입증한다.

제안 방법

  • 클라이언트와 서버의 분류기 기울기 간 차이를 기반으로 한 제어 변수를 도입하여 최종 완전 연결 레이어의 분산을 감소시킨다.
  • 기울기 감소는 마지막 몇 개의 레이어(예: VGG-11의 레이어 27–28)에만 선택적으로 적용되며, 나머지 레이어는 표준 FedAvg 업데이트를 사용한다.
  • 각 통신 라운드에서 클라이언트 간 기울기 방향과 크기의 변동성을 정량화하기 위해 드리프트 다양성 지표를 도입한다.
  • 비분산 감소 레이어에 대해 동량을 사용하여 학습을 안정화시킨다.
  • 예측 신뢰성을 향상시키기 위해 콫리포멀 예측을 적용하며, 校정을 위해 소량의 검증 세트를 사용한다.
  • 이론적으로 수렴 속도를 분석하여, 데이터 이질성에 대해 약한 의존성과 중심화된 SGD와 유사한 빠른 수렴 속도를 보임을 입증한다.

실험 결과

연구 질문

  • RQ1딥 네럴 네트워크의 어떤 레이어가 피에프드러닝에서 데이터 이질성에 가장 영향을 받는가?
  • RQ2최종 레이어에만 국한된 부분적 분산 감소가 비독립 동일 분포 설정에서 수렴 속도와 정확도를 향상시킬 수 있는가?
  • RQ3통신 효율성과 최종 모델 성능 측면에서 제안된 방법이 FedAvg, FedProx, FedDyn, SCAFFOLD와 어떻게 비교되는가?
  • RQ4비볼록 설정 하에서 제안된 방법이 증명 가능한 수렴성을 가지며, 데이터 이질성과 함께 수렴 속도가 어떻게 변화하는가?
  • RQ5칵리포멀 예측은 통신 비용을 증가시키지 않고도 신뢰성을 추가로 향상시킬 수 있는가?

주요 결과

  • FedPVR는 다양한 수준의 데이터 이질성(α=0.1에서 α=1.0)을 가진 CIFAR10 및 CIFAR100에서 FedAvg, FedProx, FedDyn, SCAFFOLD보다 더 빠른 수렴 속도를 달성한다.
  • 고정된 통신 라운드 수에서 FedPVR는 여러 설정에서 중심화된 학습과 동등하거나 그 이상의 정확도를 확보한다.
  • 최종 레이어에만 분산 감소를 적용함으로써 특징 추출 레이어에서 더 높은 기울기 다양성이 유지되어 모델 표현력이 향상된다.
  • 유사하거나 약간 더 많은 파라미터를 전송하면서도, 동일한 정확도에 도달하기 위해 기존 베이스라인보다 적은 통신 라운드 수가 필요하다.
  • 이론적 분석 결과, FedPVR는 데이터 이질성 측정치에 대해 약한 의존성을 보이며 중심화된 SGD와 유사한 수렴 속도를 확보한다.
  • 칵리포멀 예측은 적응형 예측 집합이 높은 경험적 커버리지와 함께 작은 평균 예측 집합 크기를 유지하면서도 예측 신뢰성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.