Skip to main content
QUICK REVIEW

[논문 리뷰] Where to Begin? On the Impact of Pre-Training and Initialization in Federated Learning

John Nguyen, Jianyu Wang|arXiv (Cornell University)|2022. 10. 14.
Privacy-Preserving Technologies in Data인용 수 13
한 줄 요약

이 논문은 피드버럴 러닝에서 사전 훈련과 모델 초기화의 영향을 조사하며, 사전 훈련된 모델에서 시작할 경우 수렴 속도가 빨라지고, 최종 정확도가 최대 40% 높아지며, 데이터 이질성과 시스템 이질성에 대해 더 강건함을 입증한다. 사전 훈련 초기화를 사용할 경우 적응형 서버 최적화 방법(예: FedAdam)이 이질성 인식 방법보다 훨씬 더 중요하다는 점을 보여주며, 랜덤 초기화와 사전 훈련 초기화 설정에서 모두 피드버럴 최적화 방법을 평가할 것을 제안한다.

ABSTRACT

An oft-cited challenge of federated learning is the presence of heterogeneity. \emph{Data heterogeneity} refers to the fact that data from different clients may follow very different distributions. \emph{System heterogeneity} refers to the fact that client devices have different system capabilities. A considerable number of federated optimization methods address this challenge. In the literature, empirical evaluations usually start federated training from random initialization. However, in many practical applications of federated learning, the server has access to proxy data for the training task that can be used to pre-train a model before starting federated training. We empirically study the impact of starting from a pre-trained model in federated learning using four standard federated learning benchmark datasets. Unsurprisingly, starting from a pre-trained model reduces the training time required to reach a target error rate and enables the training of more accurate models (up to 40\%) than is possible when starting from random initialization. Surprisingly, we also find that starting federated learning from a pre-trained initialization reduces the effect of both data and system heterogeneity. We recommend that future work proposing and evaluating federated optimization methods evaluate the performance when starting from random and pre-trained initializations. We also believe this study raises several questions for further work on understanding the role of heterogeneity in federated optimization.

연구 동기 및 목표

  • 모델 초기화 방식(랜덤 vs. 사전 훈련)이 피드버럴 러닝 성능에 미치는 영향을 조사하는 것.
  • 크로스 디바이스 피드버럴 러닝에서 사전 훈련이 데이터 및 시스템 이질성에 미치는 영향을 평가하는 것.
  • 기존의 피드버럴 최적화 방법이 사전 훈련보다는 이질성 인식 설계에 더 큰 이점을 얻는지 여부를 규명하는 것.
  • 사전 훈련이 피드버럴 러닝에서 수렴성과 강건성을 향상시키는 이유에 대한 경험적 및 이론적 통찰을 제공하는 것.

제안 방법

  • 저자들은 CIFAR-10, CIFAR-100, Stack Overflow(NLP), Federated EMNIST 네 가지 벤치마크 데이터셋에서 최신 15종의 피드버럴 최적화 방법을 대상으로 종합적인 경험적 연구를 수행한다.
  • 공개 프oxy 데이터를 사용한 지도 학습을 통한 사전 훈련을 통해 확보한 사전 훈련 가중치와 랜덤 초기화에서 시작했을 때의 학습 동역학과 최종 모델 정확도를 비교한다.
  • 각 최적화 방법과 데이터셋에 대해, 공정한 비교를 위해 두 초기화 유형별로 별도로 초모수를 튜닝한다.
  • 수렴 속도, 최종 테스트 정확도, 클라이언트 업데이트 간余弦 유사도, 그리고 초기화 시 최대 헤시안 고유값(부드러움)을 측정한다.
  • 다양한 피드버럴 러닝 설정에서 결과의 재현 가능성을 확보하기 위해 오픈소스 FLSim 프레임워크를 사용한다.
  • 이론적 분석은 국소 리프시츠 상수(최대 헤시안 고유값)와 클라이언트 간 업데이트 유사도를 분석함으로써 뒷받침된다.

실험 결과

연구 질문

  • RQ1사전 훈련 초기화와 랜덤 초기화를 비교할 때, 사전 훈련이 피드버럴 러닝 모델의 수렴 속도와 최종 정확도에 어떤 영향을 미치는가?
  • RQ2사전 훈련은 피드버럴 러닝에서 데이터 및 시스템 이질성의 부정적 영향을 어느 정도 줄이는가?
  • RQ3사전 훈련 초기화를 사용할 경우, 클라이언트 최적화 방법의 선택이 서버 최적화 방법의 선택보다 더 중요한가?
  • RQ4최대 헤시안 고유값으로 측정한 손실 곡면의 부드러움은 랜덤 초기화와 사전 훈련 초기화 간에 어떻게 다를까?
  • RQ5간단한 국소 SGD가 사전 훈련 가중치를 사용할 경우, 더 복잡한 이질성 인식 피드버럴 최적화 방법보다도 동일하거나 더 나은 성능을 내는가?

주요 결과

  • 사전 훈련된 모델에서 시작할 경우, 목표 정확도에 도달하기 위한 학습 라운드 수가 감소하고, 최종 모델 정확도가 랜덤 초기화 대비 최대 40% 향상된다.
  • 사전 훈련 가중치로 초기화할 경우, 적응형 최적화 방법과 비적응형 최적화 방법 간의 성능 격차가 줄어들며, 서버 측에서 FedAdam이 이질성 인식 클라이언트 방법보다 더 중요해진다.
  • 사전 훈련은 비IIDs 데이터와 시스템 이질성의 부정적 영향을 크게 줄여주며, 다양한 클라이언트 구성에서 모델 성능이 더 안정적이게 만든다.
  • 사전 훈련 가중치를 사용할 경우 초기화 시 최대 헤시안 고유값(국소 부드러움의 대체 척도)이 일관되게 작아지며, 더 나은 조건의 손실 곡면을 의미한다.
  • 사전 훈련 가중치에서 시작한 클라이언트 업데이트는 더 높은 여론 유사도를 보이며, 이는 이질적 환경에서 더 빠른 수렴과 향상된 강건성을 설명한다.
  • 간단한 국소 SGD가 사전 훈련 초기화를 사용할 경우 더 복잡한 국소 최적화 방법보다도 동일하거나 더 나은 성능을 내며, 이는 사전 훈련이 고도로 복잡한 클라이언트 측 최적화의 필요성을 줄임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.