Skip to main content
QUICK REVIEW

[논문 리뷰] Shuffled Model of Federated Learning: Privacy, Communication and Accuracy Trade-offs

Antonious M. Girgis, Deepesh Data|arXiv (Cornell University)|2020. 08. 17.
Privacy-Preserving Technologies in Data참고 문헌 45인용 수 11
한 줄 요약

이 논문은 통신 비용을 최소화하면서 강력한 프라이버시 보장을 달성하기 위해 셔플드 모델을 사용하는 통신 효율적이고 프라이버시를 보장하는 플러그 앤 플레이 분산 학습 프레임워크를 제안한다. ℓ_p 공간에서 최적의 압축 평균 추정과 클라이언트/데이터 샘플링 및 보안 셔플링을 통한 프라이버시 강화를 조합함으로써, 전체 정밀도 방법과 동일한 프라이버시-정확도 트레이드오프를 달성하면서도 통신 비용을 수십 배 이상 줄였다.

ABSTRACT

We consider a distributed empirical risk minimization (ERM) optimization problem with communication efficiency and privacy requirements, motivated by the federated learning (FL) framework. Unique challenges to the traditional ERM problem in the context of FL include (i) need to provide privacy guarantees on clients' data, (ii) compress the communication between clients and the server, since clients might have low-bandwidth links, (iii) work with a dynamic client population at each round of communication between the server and the clients, as a small fraction of clients are sampled at each round. To address these challenges we develop (optimal) communication-efficient schemes for private mean estimation for several $\ell_p$ spaces, enabling efficient gradient aggregation for each iteration of the optimization solution of the ERM. We also provide lower and upper bounds for mean estimation with privacy and communication constraints for arbitrary $\ell_p$ spaces. To get the overall communication, privacy, and optimization performance operation point, we combine this with privacy amplification opportunities inherent to this setup. Our solution takes advantage of the inherent privacy amplification provided by client sampling and data sampling at each client (through Stochastic Gradient Descent) as well as the recently developed privacy framework using anonymization, which effectively presents to the server responses that are randomly shuffled with respect to the clients. Putting these together, we demonstrate that one can get the same privacy, optimization-performance operating point developed in recent methods that use full-precision communication, but at a much lower communication cost, i.e., effectively getting communication efficiency for "free".

연구 동기 및 목표

  • 낮은 대역폭의 클라이언트 연결으로 인한 통신 비용을 최소화하면서도 강력한 프라이버시 보장을 달성하는 데 도전하는 것.
  • 로컬 차별적 프라이버시(LDP)의 한계를 극복하기 위해, 더 강력한 프라이버시 강화를 가능하게 하는 셔플드 모델을 활용하는 것.
  • 분산 학습에서 기울기 집계를 지원하기 위해 다양한 ℓ_p 노름 공간에서 최적의 통신 효율적 설계를 위한 프라이빗 평균 추정 기법을 설계하는 것.
  • 클라이언트 샘플링, SGD를 통한 데이터 샘플링, 보안 셔플링을 포함한 다중 프라이버시 강화 메커니즘을 통합하여 최적화 성능을 희생시키지 않은 채 종단 간 프라이버시를 강화하는 것.
  • 전체 정밀도 방법과 동일한 프라이버시-정확도 성능을 달성하면서도 통신 비용을 수십 배 이상 줄여, 효율성을 '무료로' 확보하는 것.

제안 방법

  • 분산 학습에 적용 가능한 ℓ_p 공간에서 프라이빗 평균 추정에 대한 순서 최적의 통신 효율적 메커니즘을 개발한다.
  • 클라이언트의 응답이 서버에 도달하기 전에 무작위로 셔플링되어 익명화되는 차별적 프라이버시의 셔플드 모델을 적용함으로써, LDP를 초월한 프라이버시 향상을 달성한다.
  • SGD에 내재된 확률적 클라이언트 샘플링 및 미니배치 데이터 샘플링을 활용해 프라이버시 손실을 감소시키는 프라이버시 강화를 실현한다.
  • 노름 부등식과 농도 경계를 활용해 프라이버시 및 통신 제약 조건 하에서 기울기 분산의 날카운 상한을 유도한다.
  • 압축된 기울기 전송과 프라이버시 보장 셔플링 및 샘플링을 조합하여 대역폭을 최소화하면서도 모델 수렴을 유지한다.
  • 다양한 ℓ_p 공간에서 통신 비용, 프라이버시(ε 기준), 최적화 오차 간의 상호 관계를 정량화하는 통합 분석 프레임워크를 활용한다.

실험 결과

연구 질문

  • RQ1분산 학습에서 임의의 ℓ_p 노름 공간에 대해 통신 효율적이고 최적의 프라이빗 평균 추정 기법을 설계할 수 있는가?
  • RQ2셔플링과 함께 클라이언트 및 데이터 샘플링을 조합할 경우, 기울기 집계에서 프라이버시를 어떻게 강화하고 노이즈 요구량을 줄일 수 있는가?
  • RQ3셔플드 FL 모델에서 통신 비용, 프라이버시(ε), 최적화 오차 간의 근본적인 트레이드오프는 무엇인가?
  • RQ4전체 정밀도 방법과 동일한 프라이버시-정확도 성능을 달성하면서도 통신 비용을 수십 배 이상 줄일 수 있는가?
  • RQ5임의의 ℓ_p 공간에서 통신 및 프라이버시 제약 조건을 동시에 고려할 때 프라이빗 평균 추정 오차의 날카운 하한 및 상한은 무엇인가?

주요 결과

  • 제안된 방법은 기존 전체 정밀도 방법과 동일한 프라이버시-정확도 운영 지점에 도달하지만, 통신 비용을 크게 줄여 통신 효율성을 '무료로' 확보한다.
  • ℓ_2 노름에 대해 L-Lipschitz 함수인 경우, 이 방법은 [BST14]에서 확립된 중심 차별적 프라이버시의 최적 초과 위험도를 달성하면서도 완전히 분산된 형태를 유지한다.
  • 알고리즘의 수렴 속도는 𝒪(LD log(T) max{d^{1/2−1/p}, 1} / √T × √(cd/(qn)) × ((e^{ε₀}+1)/(e^{ε₀}−1)))로 제한되며, 이는 프라이버시 노이즈가 모델 크기와 비선형적으로 증가함을 보여주고 통신 비용과의 상관관계를 명확히 한다.
  • 임의의 ℓ_p 공간에서 통신 및 프라이버시 제약 조건을 동시에 고려한 프라이빗 평균 추정 오차에 대해 날카운 상한 및 하한을 제공한다.
  • √(cd/(qn)) × ((e^{ε₀}+1)/(e^{ε₀}−1))가 Ω(1)일 경우, 수렴 속도는 이 항에 비례해 열악해지며, 프라이버시 예산과 통신 효율성 간의 명확한 트레이드오프를 시사한다.
  • 분석을 통해 셔플링과 샘플링의 조합이 1/√m 비례로 프라이버시 강화를 달성함을 확인하였으며, 동일한 설정에서 LDP 대비 유용성 향상이 뚜렷하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.