Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed Optimization over Block-Cyclic Data

Yucheng Ding, Chaoyue Niu|arXiv (Cornell University)|2020. 02. 18.
Privacy-Preserving Technologies in Data참고 문헌 19인용 수 8
한 줄 요약

이 논문은 블록 순환, 비독립 동일분포, 비균형 데이터를 가진 피어드 페더레이티드 러닝을 위한 두 가지 분산 최적화 알고리즘인 MM-PSGD와 MC-PSGD를 제안한다. 블록 혼합 및 블록 별도 전략을 통해 블록별 예측기 학습을 통해 두 방법 모두 수렴 속도 $O(1/\sqrt{NT})$를 달성하며, MC-PSGD는 각 블록의 최적 모델로의 수렴을 추가로 보장하여 CIFAR-10에서 FedAvg보다 최대 6% 높은 테스트 정확도를 기록한다.

ABSTRACT

We consider practical data characteristics underlying federated learning, where unbalanced and non-i.i.d. data from clients have a block-cyclic structure: each cycle contains several blocks, and each client's training data follow block-specific and non-i.i.d. distributions. Such a data structure would introduce client and block biases during the collaborative training: the single global model would be biased towards the client or block specific data. To overcome the biases, we propose two new distributed optimization algorithms called multi-model parallel SGD (MM-PSGD) and multi-chain parallel SGD (MC-PSGD) with a convergence rate of $O(1/\sqrt{NT})$, achieving a linear speedup with respect to the total number of clients. In particular, MM-PSGD adopts the block-mixed training strategy, while MC-PSGD further adds the block-separate training strategy. Both algorithms create a specific predictor for each block by averaging and comparing the historical global models generated in this block from different cycles. We extensively evaluate our algorithms over the CIFAR-10 dataset. Evaluation results demonstrate that our algorithms significantly outperform the conventional federated averaging algorithm in terms of test accuracy, and also preserve robustness for the variance of critical parameters.

연구 동기 및 목표

  • 비균형, 비독립 동일분포, 블록 순환 데이터 분포로 인한 클라이언트 및 블록 편향 문제를 해결하기 위해.
  • 실제 피어드 환경의 데이터 특성에서 수렴 보장을 유지하는 분산 최적화 알고리즘을 개발하기 위해.
  • 단일 글로벌 모델에 의존하는 대신 블록별 전용 예측기를 구성하여 테스트 정확도와 강건성을 향상시키기 위해.
  • 다양한 클라이언트 참여도, 블록 수, 로컬 반복 설정에서 제안된 알고리즘의 성능을 평가하기 위해.

제안 방법

  • MM-PSGD는 각 훈련 라운드에서 블록을 순차적으로 처리하는 블록 혼합 훈련 전략을 사용하며, 각 사이클 동안 동일한 블록에서의 이전 글로벌 모델 평균을 활용해 블록별 전용 예측기를 구성한다.
  • MC-PSGD는 MM-PSGD를 확장하여 블록 별도 훈련 전략을 도입하여, 각 블록의 데이터만을 사용해 각 블록에 대해 별도의 글로벌 모델을 유지한다.
  • 각 라운드에서 MC-PSGD는 블록 혼합 및 블록 별도 훈련 과정에서 더 우수한 성능을 보인 블록별 전용 예측기를 선택하여 수렴을 향상시킨다.
  • 이 알고리즘들은 최적의 글로벌 모델로의 수렴 속도 $O(1/\sqrt{NT})$를 보장하며, MC-PSGD는 블록별 모델에 대해 $O(\sqrt{M}/\sqrt{NT})$의 속도를 달성한다.
  • 양쪽 방법 모두 클라이언트 간 모델 평균화를 사용하며, 서버에서 로컬 업데이트를 집계함으로써 통신 효율성을 유지한다.
  • 블록 순환 데이터 구조는 여러 사이클으로 구성되며, 각 사이클은 서로 다른 비독립 동일분포를 가진 여러 데이터 블록을 포함한다.

실험 결과

연구 질문

  • RQ1블록 순환, 비독립 동일분포 데이터 하에서 기존의 피어드 평균 알고리즘이 클라이언트 및 블록 편향으로 인해 어떻게 영향을 받는가?
  • RQ2비균형, 비독립 동일분포, 블록 순환 데이터를 가진 피어드 러닝에서 블록별 전용 예측기가 수렴성과 테스트 정확도를 향상시킬 수 있는가?
  • RQ3블록 혼합 및 블록 별도 훈련 전략을 조합하면 단일 모델 기반 접근보다 더 빠른 수렴과 더 나은 일반화를 이룰 수 있는가?
  • RQ4로컬 반복 수와 블록 수의 변화가 제안된 알고리즘의 수렴 속도와 최종 정확도에 어떤 영향을 미치는가?
  • RQ5크로스 디바이스 피어드 러닝 환경에서 낮은 클라이언트 참여율 상황에서도 제안된 알고리즘이 얼마나 강건한가?

주요 결과

  • MM-PSGD와 MC-PSGD는 CIFAR-10에서 65%의 테스트 정확도를 달성하여, 블록 순환 데이터에서 수렴하지 못하고 56%에서 59% 사이를 왔다 갔던 FedAvg보다 뚜렷이 뛰어나다.
  • 셔플된 데이터를 사용한 FedAvg는 62%의 테스트 정확도를 기록하며, 제안된 방법들보다 3% 낮아, 블록 별 모델링의 우수성을 확인한다.
  • 20개의 로컬 반복을 가정할 때, MC-PSGD는 1,410라운드 내에 60% 정확도에 도달하여, 동일 조건에서 MM-PSGD가 1,610라운드가 필요로 하는 것보다 뛰어나다.
  • 블록 수 $M$가 2에서 10으로 증가함에 따라, MM-PSGD의 테스트 정확도는 63%에서 67%로 향상되지만, MC-PSGD는 64%에서 65% 사이로 안정된 성능 유지를 보인다.
  • 낮은 클라이언트 참여율 상황에서도 두 알고리즘이 강건함을 입증한다: MC-PSGD는 5% 참여율에서도 61–62%의 테스트 정확도를 기록하며, 참여율이 20%로 증가함에 따라 성능이 안정적으로 유지된다.
  • 초기 라운드에서의 계단형 정확도 증가 경향은 블록 별 전용 예측기가 첫 번째 몇 사이클 동안 크게 향상되었음을 확인하며, 특히 MM-PSGD에서 두드러진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.