Skip to main content
QUICK REVIEW

[논문 리뷰] Layer-wise Adaptive Model Aggregation for Scalable Federated Learning

Sunwoo Lee, Tuo Zhang|arXiv (Cornell University)|2021. 10. 19.
Privacy-Preserving Technologies in Data인용 수 6
한 줄 요약

이 논문은 각 레이어의 고유한 모델 이질성과 통신 비용을 바탕으로 레이어별로 동적으로 집합 간격을 조정하는 FedLAMA라는 피에르드러닝 학습을 위한 계층별 적응형 모델 집합 방법을 제안한다. 높은 이질성을 보이는 레이어는 자주 동기화하고 안정적인 레이어는 업데이트를 연기함으로써 FedLAMA는 통신 오버헤드를 줄이고 정확도 저하를 최소화하며, 다양한 비I.I.D. 데이터 설정에서 주기적인 전체 집합보다 뛰어난 성능을 발휘한다.

ABSTRACT

In Federated Learning, a common approach for aggregating local models across clients is periodic averaging of the full model parameters. It is, however, known that different layers of neural networks can have a different degree of model discrepancy across the clients. The conventional full aggregation scheme does not consider such a difference and synchronizes the whole model parameters at once, resulting in inefficient network bandwidth consumption. Aggregating the parameters that are similar across the clients does not make meaningful training progress while increasing the communication cost. We propose FedLAMA, a layer-wise model aggregation scheme for scalable Federated Learning. FedLAMA adaptively adjusts the aggregation interval in a layer-wise manner, jointly considering the model discrepancy and the communication cost. The layer-wise aggregation method enables to finely control the aggregation interval to relax the aggregation frequency without a significant impact on the model accuracy. Our empirical study shows that FedLAMA reduces the communication cost by up to 60% for IID data and 70% for non-IID data while achieving a comparable accuracy to FedAvg.

연구 동기 및 목표

  • 모든 레이어가 동일하게 동기화되는 주기적 전체 모델 집합의 비효율성을 해결하기 위해, 클라이언트 간 모델 이질성의 정도가 다르게 나타나는 상황에서도 균일하게 동기화되는 것을 방지한다.
  • 비슷한 파라미터가 클라이언트 간에 반복적으로 동기화되는 것을 최소화함으로써, 대역폭 제약이 있는 피에르드러닝 환경에서 통신 비용을 줄인다.
  • 낮은 이질성만을 보이는 레이어에 대해서만 집합 간격을 늘림으로써 모델 수렴과 정확도를 유지함으로써, 성능 저하 없이 동기화 빈도를 낮춘다.
  • 통신 효율성과 모델 정확도를 동시에 최적화하는 원칙적인 계층별 적응형 집합 전략을 제공한다.
  • 다양한 비I.I.D. 데이터 분포와 시스템 구성 조건 하에서 여러 벤치마크 데이터셋을 대상으로 제안된 방법의 실증적 검증을 수행한다.

제안 방법

  • FedLAMA는 클라이언트 간 기울기 노름 또는 파라미터 분산을 기반으로 한 새로운 이질성 지표를 사용하여 런타임에서 계층별 모델 이질성을 추정한다.
  • 전체 모델 이질성에 기여도가 높은 레이어를 순위 매기고, 이질성이 낮은 레이어에는 더 긴 집합 간격을 할당한다.
  • 각 레이어의 집합 간격은 이질성 수준과 통신 비용 간의 트레이드오���을 고려해 조정되는 요소 φ에 의해 동적으로 증가한다.
  • 학습 단계의 초기에 전체 모델 동기화를 한 번 수행한 후, 현재의 이질성 추정치를 바탕으로 각 레이어의 집합 간격을 업데이트한다.
  • 기존의 압축 기법(예: 양자화, 희소화)과의 통합을 지원하여 보완적인 통신 감소 전략으로 활용할 수 있다.
  • 비I.I.D. 데이터 하에서 부드럽고 비볼록 문제에 대해 이론적 수렴 분석을 제공하며, 제안된 적응형 전략 하에서 수렴 보장을 입증한다.

실험 결과

연구 질문

  • RQ1비I.I.D. 데이터 하에서 계층별 적응형 집합이 주기적 전체 집합에 비해 통신 효율성과 모델 정확도 측면에서 어떻게 비교되는가?
  • RQ2레이어별 집합 간격 전략이 성능 저하 없이 통신 비용을 줄일 수 있는가?
  • RQ3적응형 집합을 이끄는 데 있어 피에르드러닝 환경에서 계층별 모델 이질성을 추정하는 최적의 방법은 무엇인가?
  • RQ4간격 증가 요소 φ가 다양한 데이터셋과 데이터 분포에서 수렴과 정확도에 미치는 영향은 어떠한가?
  • RQ5비볼록이고 비I.I.D.인 피에르드러닝 학습 환경에서 적응형 집합 전략이 수렴 보장을 유지하는가?

주요 결과

  • FedLAMA는 집합 간격이 증가함에 따라 FedAvg보다 정확도 저하가 현저히 적으며, 특히 비I.I.D. 데이터 하에서 CIFAR-100과 FEMNIST에서 높은 간격에서도 1.5–2%의 정확도 향상을 기록한다.
  • 100% 클라이언트 참여 및 Dirichlet 계수 0.1 조건에서 CIFAR-10에서 FedLAMA(φ=1 기준)는 τ′=6일 때 89.52%의 정확도를 달성했고, FedAvg는 τ′=24일 때 84.82%로 떨어졌다.
  • 25% 활성 클라이언트 및 Dirichlet 계수 0.1 조건에서 FedLAMA는 τ′=12일 때 86.07%의 정확도를 유지했고, FedAvg는 τ′=24일 때 76.72%로 떨어졌다.
  • 100% 클라이언트 참여 및 Dirichlet 계수 0.1 조건에서 CIFAR-100에서 FedLAMA는 τ′=6일 때 79.78%의 정확도를 기록했고, FedAvg는 τ′=24일 때 69.63%로 떨어졌다.
  • 50% 활성 클라이언트 및 φ=1 조건에서 FEMNIST에서 FedLAMA는 86.59%의 정확도를 달성했고, FedAvg는 τ′=12일 때 85.74%였다.
  • 이 방법은 다양한 데이터 이질성 수준에서 뛰어난 강인성을 보였으며, 높은 비I.I.D. 설정(예: Dirichlet 계수 0.1)에서도 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.