Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Mixture of Experts

Matthias Reisser, Christos Louizos|arXiv (Cornell University)|2021. 07. 14.
Privacy-Preserving Technologies in Data참고 문헌 34인용 수 9
한 줄 요약

Federated Mixture of Experts (FedMix)는 클라이언트의 데이터 특성에 따라 관련 전문가를 적응적으로 선택할 수 있도록 전문화된 전문가 모델의 앙상블을 훈련하는 플래너드 러닝 프레임워크를 제안한다. 클라이언트 고유의 데이터에 조건부인 게이팅 메커니즘을 활용함으로써 FedMix는 비독립 동일 분포(non-i.i.d.) 데이터 분포, 즉 레이블 편향, 회전, 레이블 순열에 대해 FedAvg보다 성능을 향상시키며, 더 빠른 수렴과 더 나은 일반화 성능을 보인다.

ABSTRACT

Federated learning (FL) has emerged as the predominant approach for collaborative training of neural network models across multiple users, without the need to gather the data at a central location. One of the important challenges in this setting is data heterogeneity, i.e. different users have different data characteristics. For this reason, training and using a single global model might be suboptimal when considering the performance of each of the individual user's data. In this work, we tackle this problem via Federated Mixture of Experts, FedMix, a framework that allows us to train an ensemble of specialized models. FedMix adaptively selects and trains a user-specific selection of the ensemble members. We show that users with similar data characteristics select the same members and therefore share statistical strength while mitigating the effect of non-i.i.d data. Empirically, we show through an extensive experimental evaluation that FedMix improves performance compared to using a single global model across a variety of different sources of non-i.i.d.-ness.

연구 동기 및 목표

  • 클라이언트가 이질적인 데이터 분포를 가진 경우 발생하는 데이터의 비독립 동일 분포(non-i.i.d.) 문제를 해결한다.
  • 클라이언트 간 데이터가 비독립 동일 분포일 경우 성능이 떨어지는 단일 글로벌 모델(예: FedAvg)의 한계를 극복한다.
  • 클라이언트가 로컬 데이터에 맞는 전문화된 모델을 학습하고 공유하면서도 통신 효율성을 유지할 수 있도록 한다.
  • 데이터 특성에 기반한 동적 전문가 선택을 허용함으로써 모델의 일반화 능력과 수렴 속도를 향상시킨다.
  • 레이블 편향, 입력 변환, 레이블 순열을 포함한 다양한 비독립 동일 분포 데이터 소스에 대해 강건성을 입증한다.

제안 방법

  • K개의 전문가 모델을 글로벌하게 훈련하고, 게이팅 네트워크가 각 클라이언트별로 관련 전문가를 선택하는 연립 전문가(MoE) 프레임워크를 플래너드 환경에 도입한다.
  • 입력 $ x $ 와 클라이언트 식별자 $ s $ 를 조건으로 하는 클라이언트 고유의 게이팅 함수 $ p(z|x,s) $ 를 사용하여 개인화된 전문가 선택을 가능하게 한다.
  • 클라이언트가 선택한 전문가에서 국소 업데이트를 수행하고 서버에 모델 파라미터만 전송하는 방식으로 플래너드 평균화를 통해 모델을 훈련한다.
  • 게이팅 네트워크의 안정성과 과적합 방지를 위해 감쇠 메커니즘 $ ilde{q}(z|s) $ 를 도입한다.
  • 게이팅 메커니즘을 통해 클라이언트 데이터 특성의 공유 표현을 학습함으로써 미리 보지 않은 클라이언트에 대한 추론을 가능하게 한다.
  • 다양이 가능한 게이팅 메커니즘을 사용하여 전문가와 라우팅 정책을 통신 효율적인 방식으로 엔드 투 엔드로 훈련할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1클라이언트 간 데이터 분포가 상이할 경우, FedAvg에 비해 비독립 동일 분포 데이터에서 연립 전문가 프레임워크가 성능 향상을 이룰 수 있는가?
  • RQ2레이블 편향 또는 입력 변환과 같은 클라이언트 고유의 데이터 특성에 기반해 FedMix가 전문가를 적응적으로 선택할 수 있는가?
  • RQ3게이팅 네트워크가 레이블 순열과 같은 기저 데이터 분포 이동에 기반해 클라이언트를 군집화하는 데 얼마나 효과적인가?
  • RQ4측면 정보(예: 레이블 또는 회전 각도)에 기반해 게이팅 함수를 조건화하면 특정 비독립 동일 분포 데이터 유형에서 성능 향상이 이루어지는가?
  • RQ5게이팅 메커니즘을 통해 공유 클라이언트 표현을 학습함으로써 FedMix는 이전에 보지 않은 클라이언트에 일반화할 수 있는가?

주요 결과

  • FedMix는 모든 평가된 비독립 동일 분포 데이터 설정에서 FedAvg를 능가하며, 레이블 편향, 회전, 순열에 걸쳐 일관된 정확도 향상을 보였다.
  • 회전 전용 비독립 동일 분포 데이터인 회전된 MNIST에서, 게이팅을 회전 각도에 기반시킨 FedMix가 레이블에 기반시킨 경우보다 뛰어난 성능을 보였다.
  • 레이블 편향과 회전이 동시에 존재할 경우, 게이팅이 레이블 또는 회전 각도에 기반하건 간에 FedMix는 성능 향상을 보였다.
  • FedMix는 레이블 순열에 기반해 클라이언트 군집화를 성공적으로 학습하였으며, 10회의 통신 라운드 후 $ K=4 $ 전문가로 네 개의 고유한 클라이언트 그룹을 정확히 식별하였다.
  • $ K=3 $ 전문가(군집 수보다 적은 수)일 경우 한 전문가가 두 개의 클라이언트 순열을 커버하는 반면, $ K=5 $ 전문가(군집 수보다 많은 수)일 경우 한 순열이 두 전문가에 나누어지는 등 직관적인 행동을 보였다.
  • 클라이언트 군집화 작업에서 이전 방법보다 더 빠른 수렴을 보였으며, $ K=4 $ 일 때 최소 10회의 라운드 안에 정확한 군집화를 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.