Skip to main content
QUICK REVIEW

[논문 리뷰] Personalization Improves Privacy-Accuracy Tradeoffs in Federated Learning

Alberto Bietti, Chen-Yu Wei|arXiv (Cornell University)|2022. 02. 10.
Privacy-Preserving Technologies in Data인용 수 7
한 줄 요약

이 논문은 개인화된 페더레이티드 러닝 프레임워크를 제안하여 전역 모델 업데이트와 국지적 개인화 간의 균형을 통해 프라이버시-정확도 트레이드오프를 향상시킨다. 개인화 파라미터 𝛼를 조정함으로써 국지적 학습을 통해 프라이버시 비용을 줄이고 전역 모델의 효율성을 유지함으로써 사용자 수준의 차별적 프라이버시 하에서 더 나은 일반화 성능을 달성한다.

ABSTRACT

Large-scale machine learning systems often involve data distributed across a collection of users. Federated learning algorithms leverage this structure by communicating model updates to a central server, rather than entire datasets. In this paper, we study stochastic optimization algorithms for a personalized federated learning setting involving local and global models subject to user-level (joint) differential privacy. While learning a private global model induces a cost of privacy, local learning is perfectly private. We provide generalization guarantees showing that coordinating local learning with private centralized learning yields a generically useful and improved tradeoff between accuracy and privacy. We illustrate our theoretical results with experiments on synthetic and real-world datasets.

연구 동기 및 목표

  • 페더레이티드 러닝에서 모델 정확도와 사용자 수준의 차별적 프라이버시 간의 트레이드오프를 해결하기 위해.
  • 개인화가 전역 모델 학습 시 프라이버시 보장에 의해 유도되는 정확도 비용을 줄일 수 있는지 조사하기 위해.
  • 개인화 수준을 다양하게 조절할 경우 프라이버시 제약 하에서 일반화에 어떤 영향을 미치는지 수학적으로 형식화하고 분석하기 위해.
  • 다양한 데이터셋에서 개인화된 페더레이티드 러닝이 프라이버시-정확도 트레이드오프를 향상시킨다는 것을 경험적으로 검증하기 위해.

제안 방법

  • 통합 사용자 수준의 차별적 프라이버시를 고려한 개인화된 페더레이티드 러닝을 위한 확률적 최적화 프레임워크를 제안한다.
  • 전역 및 국지적 모델 업데이트 간 상대적 스텝 사이즈를 제어하는 개인화 파라미터 𝛼를 도입한다.
  • 일반화 경계를 도출하여 초과 위험( excess risk )이 통계적 항목( n 으로 감소)과 프라이버시 항목(𝛼 및 𝜖 에 의존)으로 분해됨을 보여준다.
  • 볼록 최적화 설정을 사용하여 이론적 보장을 증명하며, 프라이버시 비용이 𝛼 → 0일 때 사라짐을 보인다(국지적 학습).
  • 사용자당 반복 횟수( n )가 해당하는 샘플 수에 해당하는 페더레이티드 프라이빗 확률적 경사 하강 알고리즘을 사용한다.
  • 합성 데이터, Stackoverflow, EMNIST 데이터셋에 대해 이 방법을 적용하고, 𝛼 와 프라이버시 예산 𝜖 을 다양하게 조절하여 트레이드오프를 평가한다.

실험 결과

연구 질문

  • RQ1개인화는 페더레이티드 러닝에서 사용자 수준의 차별적 프라이버시의 정확도 비용을 줄일 수 있는가?
  • RQ2개인화 수준(𝛼 로 제어됨)이 프라이버시와 모델 정확도 간의 트레이드오프에 어떤 영향을 미치는가?
  • RQ3기본적으로 프라이버시가 보장되는 국지적 학습이 동일한 프라이버시 예산 하에서 전역 학습보다 성능이 뛰어나게 되는가?
  • RQ4어떤 환경에서 개인화가 표준 전역 학습 대비 프라이버시-정확도 트레이드오프를 크게 향상시키는가?
  • RQ5다양한 데이터 분포(예: 공유된 vs. 사용자 전용)는 최적의 개인화 수준에 어떤 영향을 미치는가?

주요 결과

  • 합성 데이터의 경우, 고도의 프라이버시 노이즈 하에서 약 200회 반복(사용자당 2000개 샘플) 후에 완전한 국지적 학습(𝛼=0)이 전역 학습(𝛼=∞)보다 성능이 뛰어나다.
  • Stackoverflow 데이터셋에서 중간 수준의 개인화(𝛼=10)는 프라이버시 없이 최고의 정확도를 달성하지만, 프라이버시 제약 하에서는 낮은 𝛼 값이 가장 우수한 성능을 보였다.
  • 페더레이티드 EMNIST에서 국지적 모델만 사용하는 경우(𝛼=0)는 공유 표현 학습 부족으로 성능이 열악했지만, 작은 𝛼 값 역시 여전히 프라이버시-정확도 트레이드오프를 향상시켰다.
  • 딥 뉴럴 네트워크(예: 4층 CNN)를 사용한 비볼록 설정에서도 작은 𝛼 값이 프라이버시-정확도 트레이드오프를 향상시켰으며, 프라이버시 없이 전역 학습이 더 정확한 경우에도 마찬가지였다.
  • 이론적 분석 결과, 𝛼 → 0일 때 프라이버시 비용 항목이 사라지며, 더 많은 데이터가 제공될수록 통계적 오차는 감소함을 보여주어灵活性 있는 트레이드오프를 가능하게 한다.
  • 실험 결과, 개인화 파라미터 𝛼 를 조정함으로써 다양한 실제 및 합성 데이터셋에서 프라이버시-정확도 트레이드오프를 체계적으로 향상시킬 수 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.