Skip to main content
QUICK REVIEW

[논문 리뷰] Clustered Sampling: Low-Variance and Improved Representativity for Clients Selection in Federated Learning

Yann Fraboni, Yu. Vertogradova|arXiv (Cornell University)|2021. 05. 12.
Privacy-Preserving Technologies in Data인용 수 47
한 줄 요약

연합 학습에서 클러스터링 샘플링으로 클라이언트를 선택해 편향 없는 집계와 가중치 분산 감소 및 더 나은 대표성을 달성하고 수렴을 개선한다.

ABSTRACT

This work addresses the problem of optimizing communications between server and clients in federated learning (FL). Current sampling approaches in FL are either biased, or non optimal in terms of server-clients communications and training stability. To overcome this issue, we introduce extit{clustered sampling} for clients selection. We prove that clustered sampling leads to better clients representatitivity and to reduced variance of the clients stochastic aggregation weights in FL. Compatibly with our theory, we provide two different clustering approaches enabling clients aggregation based on 1) sample size, and 2) models similarity. Through a series of experiments in non-iid and unbalanced scenarios, we demonstrate that model aggregation through clustered sampling consistently leads to better training convergence and variability when compared to standard sampling approaches. Our approach does not require any additional operation on the clients side, and can be seamlessly integrated in standard FL implementations. Finally, clustered sampling is compatible with existing methods and technologies for privacy enhancement, and for communication reduction through model compression.

연구 동기 및 목표

  • 연합 학습에서 서버-클라이언트 간 통신을 최적화할 필요성을 제고하고 기존 클라이언트 샘플링의 편향과 높은 분산 문제를 해결한다.
  • MD 샘플링의 편향 없는 저분산 대안으로 클러스터링 샘플링을 도입한다.
  • 클러스터링 샘플링에 대한 수렴 보장을 이론적으로 확립하고 기저선으로서 MD 샘플링과 함께 제시한다.
  • 반복 간 대표성을 향상시키고 집계 가중치 분산을 줄이는 실용적인 클러스터링 기반 구현을 제시한다.

제안 방법

  • 다중 독립 분포 W_k(t)를 사용하여 m개의 클라이언트를 선택하는 MD 샘플링의 일반화로서 클러스터링 샘플링을 정의한다.
  • m개의 분포에 걸쳐 r_{k,i}^t 확률을 만족시키는 것이 무편향 글로벌 집계를 산출함을 증명한다 (합계 r_{k,i}^t = m p_i).
  • 클러스터링 샘플링이 MD 샘플링과 동일한 수렴 경계(O(1/√(mNT)) + O(mN/T))를 유지함을 증명한다.
  • 두 가지 실용적 클러스터링 접근법을 제시한다: (i) 클라이언트 샘플 크기에 기반한 방법(Algorithm 1) 및 (ii) 모델/업데이트 유사성에 기반한 방법(Algorithm 2).
  • 추가 클라이언트 측 작업 없이도 균일한 무편향성과 실용적 구현에 이론을 확장한다.
  • 개인정보 보호 및 통신 감소 기법과의 호환성에 대해 논의한다.

실험 결과

연구 질문

  • RQ1클러스터링 샘플링이 MD 샘플링처럼 편향 없는 집계를 제공하면서 클라이언트 집계 가중치의 분산을 줄일 수 있는가?
  • RQ2FL에서 이질적(비 iid, 비균형) 클라이언트 데이터의 대표성에 클러스터링이 어떤 영향을 미치는가?
  • RQ3샘플 크기 및 유사성에 따른 실용적 클러스터링 기반 샘플링 방식이 MD 샘플링과 비교하여 수렴 속도와 안정성을 향상시킬 수 있는가?
  • RQ4기존 접근법에 비해 클러스터링 샘플링의 이론적 수렴 보장은 무엇인가?
  • RQ5제안된 알고리즘이 비 iid 파티션을 가진 표준 벤치마크(MNIST, CIFAR-10)에서 어떻게 작동하는가?

주요 결과

  • 적절한 조건에서 클러스터링 샘플링은 MD 샘플링과 동일한 수렴 경계를 달성하여 FL 최적화에 대한 이론적 보장을 유지한다.
  • 클러스터링 샘플링은 MD 샘플링에 비해 클라이언트 가중치의 분산을 감소시켜 각 클라이언트의 대표성을 향상시킨다.
  • 클러스터링은 반복에 걸쳐 모든 클라이언트를 더 많이 샘플링할 확률을 제공하여 이질적 데이터의 더 나은 표현으로 이어진다.
  • 샘플 크기(Algorithm 1) 및 유사성(Algorithm 2)에 기반한 알고리즘은 실용적이며, 후자는 비슷한 클라이언트를 더 잘 대표하도록 한다.
  • MNIST 및 CIFAR-10에서의 실험은 MD 샘플링에 비해 향상된 학습 수렴과 감소된 변동성을 보여주며, 특히 데이터 이질성이 높은 경우에 그렇다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.