Skip to main content
QUICK REVIEW

[논문 리뷰] Federated learning with hierarchical clustering of local updates to improve training on non-IID data

Christopher Briggs, Fan Zhong|arXiv (Cornell University)|2020. 04. 24.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 비iID 데이터에서의 훈련을 향상시키기 위해 클라이언트를 로컬 모델 업데이트의 유사성에 기반해 군집화하는 계층적 클러스터링을 통합한 플랫폼 학습(FL+HC)을 제안한다. FL+HC는 커뮤니케이션 라운드를 5배 이상 줄이고, 비iID 환경에서 목표 정확도에 도달한 클라이언트 수를 최대 2배까지 증가시킨다. 특히 맨하탄 거리와 완전 연결 방식을 사용할 경우 뛰어난 성능을 보인다.

ABSTRACT

Federated learning (FL) is a well established method for performing machine learning tasks over massively distributed data. However in settings where data is distributed in a non-iid (not independent and identically distributed) fashion -- as is typical in real world situations -- the joint model produced by FL suffers in terms of test set accuracy and/or communication costs compared to training on iid data. We show that learning a single joint model is often not optimal in the presence of certain types of non-iid data. In this work we present a modification to FL by introducing a hierarchical clustering step (FL+HC) to separate clusters of clients by the similarity of their local updates to the global joint model. Once separated, the clusters are trained independently and in parallel on specialised models. We present a robust empirical analysis of the hyperparameters for FL+HC for several iid and non-iid settings. We show how FL+HC allows model training to converge in fewer communication rounds (significantly so under some non-iid settings) compared to FL without clustering. Additionally, FL+HC allows for a greater percentage of clients to reach a target accuracy compared to standard FL. Finally we make suggestions for good default hyperparameters to promote superior performing specialised models without modifying the the underlying federated learning communication protocol.

연구 동기 및 목표

  • 데이터가 비iID일 경우, 특히 클라이언트 간 통계적 이질성으로 인해 발생하는 성능 저하 문제를 해결하기 위함.
  • 기본 플랫폼 학습 커뮤니케이션 프로토콜을 수정하지 않고도 비iID 환경에서 모델 정확도와 수렴 속도를 향상시키기 위함.
  • 플랫폼 학습에서 계층적 클러스터링에 적합한 하이퍼파라미터를 식별하여 데이터 분포가 알려지지 않은 경우에도 강건하고 기본적인 설정을 가능하게 하기 위함.
  • 다양한 비iID 데이터 시나리오에서 클러스터링 거리 측정법과 연결 방법이 모델 성능에 미치는 영향을 평가하기 위함.

제안 방법

  • 고정된 수의 플랫폼 학습 커뮤니케이션 라운드 이후 클라이언트의 로컬 모델 가중치 업데이트 간 유사성에 기반해 클라이언트를 군집화하는 계층적 클러스터링 단계를 도입한다.
  • 클라이언트 업데이트 간 유사성을 측정하기 위해 L2, L1, 맨하탄, 코사인 거리 측정법을 사용한다.
  • 클라이언트 간 유사한 업데이트 패턴을 가진 군집을 형성하기 위해 완전, 평균, 단일, 워드 연결 방법을 적용한다.
  • 각 군집에 대해 독립적으로 전문화된 모델을 훈련시어 단일 글로벌 모델보다 성능을 향상시킨다.
  • 글로벌 모델 집계에는 플랫폼 평균(FedAvg)을 사용하며, 클러스터링은 훈련 중 주기적으로 적용된다.
  • 여러 데이터셋과 비iID 설정에서 테스트 정확도 및 목표 정확도 기준에 도달한 클라이언트 수를 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1비iID 플랫폼 학습 환경에서 클라이언트 업데이트의 계층적 클러스터링은 수렴 속도와 테스트 정확도에 어떤 영향을 미치는가?
  • RQ2계층적 클러스터링에서 어떤 거리 측정법과 연결 방법이 다양한 종류의 비iID 데이터에서 최고의 성능을 낳는가?
  • RQ3표준 플랫폼 학습 대비 FL+HC는 커뮤니케이션 라운드를 줄이면서도 모델 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ4데이터 비iID 분포의 성격이 알려지지 않은 경우, FL+HC의 최적 기본 하이퍼파라미터는 무엇인가?

주요 결과

  • 특정 비iID 환경에서 FL+HC는 수렴에 필요한 커뮤니케이션 라운드 수를 5배 이상 줄였으며, 특히 맨하탄 거리와 완전 연결 방식을 사용할 경우 뚜렷한 성능 향상을 보였다.
  • 라벨 뒤집힘 비iID 환경에서는 다른 거리 측정법에 비해 코사인 거리 측정법이 약간 더 높은 성능을 보였다.
  • 맨하탄 거리 측정법과 완전 연결 방식을 조합하면 표준 플랫폼 학습 대비 1.1배 더 많은 클라이언트가 50라운드까지 목표 정확도에 도달했다.
  • FL+HC는 비iID 환경에서 목표 정확도에 도달한 클라이언트 수를 최대 2배까지 증가시키며, 최종 테스트 정확도를 유지하거나 향상시켰다.
  • 사용자 기반 데이터 분할 방식을 사용한 FEMNIST 비iID 설정에서는 FL+HC가 표준 플랫폼 학습에 비해 큰 이점이 없었으며, 이는 복잡한 조건부 분포 이질성 하에서의 한계를 시사한다.
  • 알 수 없는 비iID 데이터에 대한 권장 기본 설정은 맨하탄 거리와 완전 연결 방식이며, 이는 클라이언트 수렴 속도와 강건성 측면에서 다른 조합들보다 뛰어난 성능을 지속적으로 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.