Skip to main content
QUICK REVIEW

[논문 리뷰] FedMAX: Mitigating Activation Divergence for Accurate and Communication-Efficient Federated Learning

Wei Chen, Kartikeya Bhardwaj|arXiv (Cornell University)|2020. 04. 07.
Privacy-Preserving Technologies in Data참고 문헌 20인용 수 10
한 줄 요약

FedMAX는 비독립identically distributed (non-IID) 데이터로 인한 활성화 분산 문제를 해결하기 위해 국소 활성화 벡터에 최대 엔트로피 사전을 도입하여 기기 간 유사성을 향상시키는 새로운 분산 학습 프레임워크를 제안한다. 이는 CIFAR-10, CIFAR-100, FEMNIST 및 의료 데이터셋에서 FedAvg와 FedProx보다 최대 5배 적은 통신 라운드를 통해 더 높은 정확도를 달성한다.

ABSTRACT

In this paper, we identify a new phenomenon called activation-divergence which occurs in Federated Learning (FL) due to data heterogeneity (i.e., data being non-IID) across multiple users. Specifically, we argue that the activation vectors in FL can diverge, even if subsets of users share a few common classes with data residing on different devices. To address the activation-divergence issue, we introduce a prior based on the principle of maximum entropy; this prior assumes minimal information about the per-device activation vectors and aims at making the activation vectors of same classes as similar as possible across multiple devices. Our results show that, for both IID and non-IID settings, our proposed approach results in better accuracy (due to the significantly more similar activation vectors across multiple devices), and is more communication-efficient than state-of-the-art approaches in FL. Finally, we illustrate the effectiveness of our approach on a few common benchmarks and two large medical datasets.

연구 동기 및 목표

  • 서로 다른 기기 간에 동일한 클래스 레이블을 공유하더라도 활성화 벡터가 상이해지는 비독립identically distributed 데이터로 인한 활성화 분산 문제를 해결한다.
  • 공유되는 글로벌 데이터가 필요 없이 기기 간 활성화 표현을 정렬함으로써 IID 및 non-IID 환경 모두에서 모델 정확도를 향상시킨다.
  • 정확도 저하 없이 더 긴 로컬 학습 에포크를 허용함으로써 통신 효율성을 향상시키고 통신 라운드 수를 줄인다.
  • 데이터 공유 없이도 높은 성능을 유지하면서 기밀성을 보장하는 솔루션을 제공한다.

제안 방법

  • 각 기기의 활성화 벡터에 대해 최소한의 정보를 가정하는 최대 엔트로피 사전을 도입하여 동일한 클래스에 대해 기기 간 유사성과 균일성을 증진시킨다.
  • 표준 교차 엔트로피 손실와 활성화 벡터의 L2 노름 페널티를 조합한 정규화된 손실 함수를 제안하여 밀도 있고 유사한 표현을 유도한다.
  • 동일한 클래스 레이블을 기기 간 공유하는 조건 하에 활성화 분포가 가능한 한 균일하도록 최대 엔트로피 원리를 적용한다.
  • 각 통신 라운드 동안 새로운 사전을 적용하여 로컬 모델을 훈련하고, FedAvg 방식의 평균화를 통해 글로벌 모델 가중치를 집계한다.
  • t-SNE 시각화를 활용해 FedMAX와 FedAvg 간 기기 간 활성화 벡터 군집화를 분석하고 비교하여 정렬성이 향상됨을 시각적으로 입증한다.
  • 실제 벤치마크 및 두 개의 대규모 의료 데이터셋(APTOS 및 흉부 X-ray)을 포함한 IID 및 non-IID 데이터 분할 조건에서 방법을 평가한다.

실험 결과

연구 질문

  • RQ1비독립identically distributed 조건에서 사용자가 공통 클래스를 공유하더라도 활성화 분산이 모델 정확도를 얼마나 악화시키는가?
  • RQ2국소 활성화 벡터에 최대 엔트로피 사전을 강제 적용함으로써 기기 간 분산을 줄이고 일반화 성능을 향상시킬 수 있는가?
  • RQ3다양한 데이터셋에서 FedMAX가 FedAvg 및 FedProx에 비해 테스트 정확도와 통신 효율성 측면에서 어떻게 비교되는가?
  • RQ4데이터 공유가 불가능한 기밀성이 중요한 의료 데이터셋에서도 FedMAX가 성능 향상을 유지하는가?
  • RQ5제안된 방법이 모델 성능을 희생시키지 않고 목표 정확도에 도달하기 위해 필요한 통신 라운드 수를 줄일 수 있는가?

주요 결과

  • 비독립identically distributed 조건에서 CIFAR-10 데이터셋에서 FedMAX는 FedAvg보다 5.64%에서 5.84% 높은 테스트 정확도를 달성한다.
  • CIFAR-10에서 FedMAX는 정확도를 유지하거나 향상시키면서 FedAvg 및 FedProx 대비 최대 5배 적은 통신 라운드를 요구한다.
  • t-SNE 시각화 결과, FedMAX에서는 FedAvg에 비해 특히 6~15 에포크 이후 동일한 클래스의 활성화 벡터가 기기 간 더 단단히 군집되어 있음을 확인할 수 있다.
  • FEMNIST 및 CIFAR-100 데이터셋에서 IID 및 non-IID 조건 모두에서 FedMAX는 FedAvg 및 FedProx를 초월하여 정확도와 통신 효율성 측면에서 일관된 성능 향상을 보였다.
  • APTOS 의료 데이터셋(IID 조건)에서 FedMAX는 FedAvg에 비해 측정 가능한 성능 향상을 보였으며, 데이터 수가 적은 Chest X-ray 데이터셋에서는 제한된 데이터로 인한 분산이 적어 성능이 유사했다.
  • 의료 데이터셋에서는 활성화 벡터에 대한 L2 정규화가 성능 향상에 기여했으나, CIFAR-10에서는 성능이 열 劣화되어 데이터셋에 따라 민감도가 다름을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.