[논문 리뷰] Is Shapley Value fair? Improving Client Selection for Mavericks in Federated Learning
이 논문은 워샤르스타인 거리로 데이터 분포의 산란도를 측정하여, 희귀하거나 고유한 데이터 클래스를 가진 클라이언트(Mavericks)를 우선시함으로써 수렴을 향상시키는 새로운 클라이언트 선택 전략인 FedEMD를 제안한다. FedEMD는 Shapley Value와 최신 기술보다 FedAvg 환경에서 수렴 속도를 최소 26.9% 빠르게 하며, 특히 데이터 분포가 비대칭인 상황에서 뛰어난 성능을 보인다.
Shapley Value is commonly adopted to measure and incentivize client participation in federated learning. In this paper, we show -- theoretically and through simulations -- that Shapley Value underestimates the contribution of a common type of client: the Maverick. Mavericks are clients that differ both in data distribution and data quantity and can be the sole owners of certain types of data. Selecting the right clients at the right moment is important for federated learning to reduce convergence times and improve accuracy. We propose FedEMD, an adaptive client selection strategy based on the Wasserstein distance between the local and global data distributions. As FedEMD adapts the selection probability such that Mavericks are preferably selected when the model benefits from improvement on rare classes, it consistently ensures the fast convergence in the presence of different types of Mavericks. Compared to existing strategies, including Shapley Value-based ones, FedEMD improves the convergence of neural network classifiers by at least 26.9% for FedAvg aggregation compared with the state of the art.
연구 동기 및 목표
- 피드포워드 학습에서 희귀하거나 고유한 데이터 클래스를 가진 클라이언트(Mavericks)의 기여도를 Shapley Value가 공정하게 평가하는지 조사하는 것.
- 비독립 동일 분포(non-i.i.i.d.) 데이터 분포에서 희귀 클래스 소유가 비대칭인 경우 기존 클라이언트 선택 전략, 특히 Shapley Value의 한계를 해결하는 것.
- 희귀 클래스 학습에 가장 기여할 수 있는 시점에 Mavericks를 적응적으로 우선시하는 클라이언트 선택 전략을 설계하는 것.
- 특히 워샤르스타인 거리 기반의 데이터 분포 기반 선택 전략이 점수 기반 또는 무작위 선택보다 수렴 속도를 빠르게 하는지 입증하는 것.
제안 방법
- FedEMD는 클라이언트의 국소 데이터 분포와 글로벌 데이터 분포 간의 워샤르스타인 거리를 사용하여 선택 확률을 계산한다.
- 글로벌 분포에서 더 큰 산란도를 보이는 클라이언트—특히 Mavericks—는 초기 학습 라운드에서 더 높은 선택 확률을 부여받는다.
- 선택 확률은 라운드에 따라 동적으로 조정되며, Mavericks의 데이터가 글로벌 모델의 희귀 클래스 학습에 가장 기여할 수 있을 때 그들을 우선시한다.
- 이 방법은 경량이며, 모델 재학습 없이도 FedAvg 및 기타 집계 방식과 원활하게 통합된다.
- 모델 정확도가 안정화됨에 따라 선택 확률을 감소시켜 후기 단계에서 Mavericks를 과도하게 가중하지 않는다.
- 이 방법은 데이터 양의 불균형과 분포 이탈, 특히 비독립 동일 분포 피드포워드 학습 환경에서 강건하도록 설계되어 있다.
실험 결과
연구 질문
- RQ1Shapley Value는 피드포워드 학습에서 희귀하거나 고유한 데이터 클래스를 소유한 클라이언트(Mavericks)의 기여도를 공정하게 평가하는가?
- RQ2기여도 측정이 편향되어 Mavericks가 부족하게 나타날 경우, 클라이언트 선택 전략의 성능은 어떻게 저하되는가?
- RQ3워샤르스타인 거리를 활용한 분포 기반 클라이언트 선택 전략이 비독립 동일 분포 피드포워드 학습에서 수렴 속도를 향상시킬 수 있는가?
- RQ4FedEMD는 수렴 속도와 안정성 측면에서 Shapley Value 및 최신 기술의 클라이언트 선택 방법보다 얼마나 뛰어나게 성능을 발휘하는가?
- RQ5다양한 종류의 Mavericks, 즉 고유 소유 및 공유 소유의 희귀 클래스에 대해 FedEMD는 어떤 성능을 보이는가?
주요 결과
- FedEMD는 FedAvg 환경에서 최신 기술 대비 최소 26.9% 빠른 수렴을 달성하며, 비독립 동일 분포 상황에서 이는 더욱 두드러진다.
- Shapley Value 기반 선택은 초기 학습 단계에서 Mavericks의 기여도를 과소평가한다. 이는 그들의 데이터 분포가 글로벌 모델과의 산란도가 크기 때문이다.
- MNIST, FMNIST, Cifar-10, STL-10을 포함한 모든 데이터셋에서 FedEMD는 랜덤, TiFL, FedFast, FedProx, FedSGD보다 수렴 속도가 빠르며 일관되게 뛰어난 성능을 보인다.
- 고유 소유의 Mavericks에 대해서는 FedEMD가 가장 빠른 수렴 속도를 기록하며, FedFast와 TiFL는 군집화나 무작위 요인으로 인해 성능 저하 또는 불안정한 동작을 보인다.
- 공유 Mavericks 설정에서는 FedEMD가 빠른 수렴 속도와 낮은 표준편차를 유지하여 다른 방법보다 더 높은 안정성을 보인다.
- 공유 Mavericks가 많아질수록 FedEMD의 수렴 속도는 약간 향상되며, 이는 균형 잡힌 분포가 i.i.d. 설정과 유사해져 무작위 선택이 잘 작동하는 환경이 되기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.