Skip to main content
QUICK REVIEW

[논문 리뷰] Mixed Federated Learning: Joint Decentralized and Centralized Learning

Sean Augenstein, Andrew Hard|arXiv (Cornell University)|2022. 05. 26.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 분산(연합) 및 중심집중식(데이터센터) 손실을 동시에 최적화하면서도 클라이언트 데이터의 기밀성을 유지하는 새로운 프레임워크인 혼합 연합 학습(Mixed Federated Learning)을 소개한다. 서버 측 손실 항목을 통합하고, Parallel Training, 1-way Gradient Transfer, 2-way Gradient Transfer의 세 가지 알고리즘을 제안함으로써, 통신 및 계산 오버헤드를 90% 이상 감소시키며, 분포 매칭 시나리오에서 오라클 수준의 정확도를 달성한다.

ABSTRACT

Federated learning (FL) enables learning from decentralized privacy-sensitive data, with computations on raw data confined to take place at edge clients. This paper introduces mixed FL, which incorporates an additional loss term calculated at the coordinating server (while maintaining FL's private data restrictions). There are numerous benefits. For example, additional datacenter data can be leveraged to jointly learn from centralized (datacenter) and decentralized (federated) training data and better match an expected inference data distribution. Mixed FL also enables offloading some intensive computations (e.g., embedding regularization) to the server, greatly reducing communication and client computation load. For these and other mixed FL use cases, we present three algorithms: PARALLEL TRAINING, 1-WAY GRADIENT TRANSFER, and 2-WAY GRADIENT TRANSFER. We state convergence bounds for each, and give intuition on which are suited to particular mixed FL problems. Finally we perform extensive experiments on three tasks, demonstrating that mixed FL can blend training data to achieve an oracle's accuracy on an inference distribution, and can reduce communication and computation overhead by over 90%. Our experiments confirm theoretical predictions of how algorithms perform under different mixed FL problem settings.

연구 동기 및 목표

  • 연합 학습에서 지속적인 분포 이탈 문제를 해결하기 위해 클라이언트 데이터와 데이터센터 데이터를 결합한다.
  • 대규모 음성 샘플링 또는 임bedding 정규화가 필요한 표현 학습 작업에서 클라이언트 측 계산 및 통신 오버헤드를 감소시킨다.
  • 원시 클라이언트 데이터가 기기 외부로 나가지 않도록 보장하면서도, 서버 측 목표와의 공동 최적화를 가능하게 하여 데이터 기밀성을 유지한다.
  • 일般적인 비볼록 및 강력 볼록 설정에서 수렴하는, 이론적으로 탄탄한 기밀 보장 알고리즘을 제공한다.
  • 모바일 키보드 예측, 얼굴 속성 분류, 추천 시스템과 같은 실세계 응용 분야에서 혼합 연합 학습의 실용적 구현을 가능하게 한다.

제안 방법

  • Parallel Training (PT), 1-way Gradient Transfer (1-w GT), 2-way Gradient Transfer (2-w GT)의 세 가지 알고리즘을 제안하며, 클라이언트 데이터를 기기 내부에 유지함으로써 기밀성을 보장한다.
  • 혼합 손실 함수 $ f(\bm{x}) = f_{\textrm{f}}(\bm{x}) + f_{\textrm{c}}(\bm{x}) $ 를 도입하며, 여기서 $ f_{\textrm{f}} $ 는 연합 손실이고 $ f_{\textrm{c}} $ 는 서버에서 계산되는 중심집중식 손실이다.
  • 1-w GT에서는 서버 측 손실에서 유도된 기울기가 클라이언트로 전송되어 클라이언트 모델 업데이트를 향상시키며, 2-w GT에서는 클라이언트와 서버의 기울기가 상호 교환된다.
  • PT와 2-w GT를 분석하기 위해 '메타-FL' 시각을 도입하여 $ f_{\textrm{f}} $ 와 $ f_{\textrm{c}} $ 를 메타-클라이언트로 간주함으로써, 부드러움과 분산 유한성 가정 하에 수렴 한계를 도출한다.
  • 재귀적 경계와 확률적 기울기 분산 제어를 활용하여 비볼록 설정에서 1-w GT의 새로운 수렴 증명을 유도한다.
  • 클라이언트 드리프트를 제어하고 수렴을 보장하기 위해 메타 최적화 시각을 적용하며, 표준 가정(리프시츠 스무쓰니스, 유한 기울기) 하에 이론적 보장을 확보한다.

실험 결과

연구 질문

  • RQ1추론 분포가 학습 분포와 다를 경우, 중심집중식 데이터와 분산 클라이언트 데이터를 함께 학습함으로써 모델 일반화가 향상되는가?
  • RQ2표현 학습에서 정규화 항을 서버에서 계산함으로써 클라이언트 측 통신 및 계산 비용은 얼마나 감소할 수 있는가?
  • RQ3다양한 데이터 및 시스템 조건에서, 다양한 혼합 FL 알고리즘(PT, 1-w GT, 2-w GT)의 수렴 속도와 내성은 어떻게 비교되는가?
  • RQ4비볼록 설정에서 혼합 FL에 대한 이론적 수렴 한계를 설정할 수 있으며, 이는 실증 성능와 일치하는가?
  • RQ5클라이언트와 데이터센터에 분할된 데이터가 있을 때, 혼합 FL이 전체 추론 분포를 기반으로 학습된 '오라클' 모델과 유사한 성능을 달성할 수 있는가?

주요 결과

  • 사용자 임베딩 기반 영화 추천 작업에서 혼합 FL은 통신 오버헤드를 93.9% 감소시키고 클라이언트 계산을 99.9% 감소시켰으며, 모델 품질에 영향을 주지 않았다.
  • 얼굴 속성 분류 및 언어 모델링 작업에서 혼합 FL은 전체 추론 분포를 기반으로 학습된 오라클 모델과 동일한 정확도를 달성했다.
  • 모든 세 알고리즘에 대해 강력 볼록, 일반 볼록, 비볼록 설정에서 이론적 수렴 한계가 성립하며, 데이터 분산과 스텝 사이즈에 명시적인 의존성이 있다.
  • 1-w GT 알고리즘은 수렴 속도가 $ \mathcal{O}\left(\frac{\left(\sigma^{2}+KS\sigma_{\textrm{c}}^{2}\right)\beta F}{KS\epsilon^{2}} + \frac{\beta F}{\epsilon}\right) $ 로 확인되어 비선형 수렴을 확인한다.
  • 실험 결과는 이론적 예측을 확인하였으며, 다양한 혼합 FL 문제 설정에서 성능이 수렴 한계와 일치함을 입증했다.
  • 제안된 알고리즘은 저성능 기기와 희귀한 안전 중심 이벤트 데이터를 포함한 다양한 소스의 데이터를 융합함으로써 분포 이탈을 효과적으로 완화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.