Skip to main content
QUICK REVIEW

[논문 리뷰] FedShuffle: Recipes for Better Use of Local Work in Federated Learning

Samuel Horváth, Maziar Sanjabi|arXiv (Cornell University)|2022. 04. 27.
Privacy-Preserving Technologies in Data인용 수 6
한 줄 요약

FedShuffle는 랜덤 셔플링, 데이터 불균형 처리, 클라이언트 샘플링을 통합함으로써 로컬 업데이트 활용도를 향상시키는 새로운 피어드 학습 프레임워크를 제안한다. 이는 이러한 현실적인 조건 하에서 처음으로 이론적 수렴 보장을 제공하며, FedAvg의 목적 함수 일致성 문제를 해결하고, 부분 참여 및 이질적 데이터 조건에서 FedNova 및 모멘타임이 있는 FedAvg를 능가한다.

ABSTRACT

The practice of applying several local updates before aggregation across clients has been empirically shown to be a successful approach to overcoming the communication bottleneck in Federated Learning (FL). Such methods are usually implemented by having clients perform one or more epochs of local training per round while randomly reshuffling their finite dataset in each epoch. Data imbalance, where clients have different numbers of local training samples, is ubiquitous in FL applications, resulting in different clients performing different numbers of local updates in each round. In this work, we propose a general recipe, FedShuffle, that better utilizes the local updates in FL, especially in this regime encompassing random reshuffling and heterogeneity. FedShuffle is the first local update method with theoretical convergence guarantees that incorporates random reshuffling, data imbalance, and client sampling - features that are essential in large-scale cross-device FL. We present a comprehensive theoretical analysis of FedShuffle and show, both theoretically and empirically, that it does not suffer from the objective function mismatch that is present in FL methods that assume homogeneous updates in heterogeneous FL setups, such as FedAvg (McMahan et al., 2017). In addition, by combining the ingredients above, FedShuffle improves upon FedNova (Wang et al., 2020), which was previously proposed to solve this mismatch. Similar to Mime (Karimireddy et al., 2020), we show that FedShuffle with momentum variance reduction (Cutkosky & Orabona, 2019) improves upon non-local methods under a Hessian similarity assumption.

연구 동기 및 목표

  • 클라이언트가 데이터 불균형으로 인해 다른 수의 로컬 업데이트를 수행함에 따라 발생하는 목적 함수 일치성 문제를 해결한다.
  • 랜덤 셔플링, 데이터 이질성, 클라이언트 샘플링을 포함한 현실적인 피어드 학습 환경에서 로컬 업데이트 방법에 대한 이론적 수렴 보장을 제공한다.
  • 랜덤 셔플링 통합 및 완전하지 않은 로컬 학습 라운드에 대한 개선된 처리 방식을 통해 FedNova를 초월한다.
  • 수백만 대의 디바이스를 포함하는 대규모 크로스 디바이스 피어드 학습 환경에 적합한 상태 없는 확장 가능한 피어드 최적화를 가능하게 한다.
  • 모멘타임 분산 감소 기법을 셔플링 및 이질적 업데이트와 융합하여 헤시안 유사성 가정 하에서 수렴을 향상시킨다.

제안 방법

  • 각 로컬 에포크에서 클라이언트 데이터를 랜덤 셔플링하는 FedShuffle을 도입하여 분산 감소 및 수렴 향상을 보장한다.
  • 클라이언트별로 다른 수의 로컬 스텝을 고려한 새로운 집계 규칙을 설계하여 FedAvg 및 FedNova에서 발생하는 목적 함수 불일치 문제를 수정한다.
  • 시스템 제약으로 인한 완전하지 않은 로컬 라운드를 처리하기 위해 스텝 크기 스케일링과 업데이트 가중치를 조합한 하이브리드 변형인 FedShuffleGen을 제안한다.
  • FedShuffle 내부에서 Cutkosky & Orabona (2019)의 모멘타임 분산 감소 기법을 활용하여 헤시안 유사성 가정 하에서 수렴을 향상시킨다.
  • 클라이언트 손실의 가중합으로 최적화 문제를 수식화하며, 데이터 크기에 비례하는 클라이언트별 가중치를 설정하여 글로벌 목적 함수의 일致성 확보한다.
  • 각 라운드에서 디바이스의 일부만 참여하는 클라이언트 샘플링 전략을 구현하여 실제 크로스 디바이스 피어드 학습 환경의 제약 조건을 반영한다.

실험 결과

연구 질문

  • RQ1대규모 피어드 학습에서 핵심적인 기능인 랜덤 셔플링, 데이터 불균형, 클라이언트 샘플링를 고려한 피어드 학습 방법이 이론적 수렴을 달성할 수 있는가?
  • RQ2FedShuffle는 클라이언트가 다른 수의 로컬 업데이트를 수행할 경우 FedAvg 및 FedNova가 앓는 목적 함수 불일치 문제를 어떻게 완화하는가?
  • RQ3랜덤 셔플링과 모멘타임 분산 감소 기법을 융합하면 이질적, 비독립 동일 분포(Non-IID) 피어드 학습 환경에서 수렴을 향상시킬 수 있는가?
  • RQ4부분 참여 및 실제 데이터 조건에서 FedShuffle은 FedAvg, FedNova, 모멘타임이 있는 FedAvg와 비교해 어떻게 성능을 발휘하는가?
  • RQ5하이브리드 집계 전략(FedShuffleGen)은 실전과 유사한 환경에서 완전하지 않은 로컬 학습 라운드로 인한 목적 함수 불일치 문제를 효과적으로 수정할 수 있는가?

주요 결과

  • FedShuffle는 이전의 로컬 업데이트 방법에서 다루지 못한 랜덤 셔플링, 데이터 불균형, 클라이언트 샘플링 조건 하에서도 이론적 수렴을 달성한다.
  • FedShuffle는 클라이언트의 로컬 업데이트 횟수에 따라 동적으로 집계 가중치를 조정함으로써 FedAvg 및 FedNova에 내재된 목적 함수 불일치 문제를 제거한다.
  • LSTM 기반의 Shakespeare 데이터셋에서, 부분 참여(라운드당 16명의 클라이언트) 조건 하에서 모멘타임이 있는 FedShuffle은 FedAvg 및 FedNova보다 더 빠른 수렴 속도와 낮은 훈련 손실을 기록한다.
  • ResNet18 기반의 CIFAR100 데이터셋에서, 로컬 에포크 수가 클라이언트별로 랜덤하게 변동(2–5 에포크)하는 조건에서 FedShuffle은 검증 정확도에서 FedAvg 및 FedNova를 능가한다.
  • 이차 목적 함수 실험에서, FedShuffle와 FedNova 스타일 집계를 융합한 FedShuffleGen은 뛰어난 성능을 기록하며, 완전하지 않은 로컬 라운드로 인한 목적 함수 불일치 문제를 해결한다.
  • FedShuffle에 모멘타임 분산 감소 기법을 통합함으로써 헤시안 유사성 가정 하에서 더 빠른 수렴 속도를 확보하였으며, 유사 조건에서 Mime의 성능을 따라하거나 초월한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.