Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Learning with Differential Privacy

Adrien Banse, Jan Kreischer|arXiv (Cornell University)|2024. 02. 03.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

이 논문은 MNIST, FEMNIST 및 실생활 의료 데이터셋에서 비밀성 보장이 있는 분산 학습(DP)을 평가하여, 노이즈 주입과 기울기 클리핑으로 인해 비밀성 보장은 유지되지만 모델 정확도가 크게 떨어지며, 특히 비i.i.d. 데이터 또는 작은 데이터셋에서는 이 문제가 더욱 심각하다고 밝힘.

ABSTRACT

Federated learning (FL), as a type of distributed machine learning, is capable of significantly preserving client's private data from being shared among different parties. Nevertheless, private information can still be divulged by analyzing uploaded parameter weights from clients. In this report, we showcase our empirical benchmark of the effect of the number of clients and the addition of differential privacy (DP) mechanisms on the performance of the model on different types of data. Our results show that non-i.i.d and small datasets have the highest decrease in performance in a distributed and differentially private setting.

연구 동기 및 목표

  • 분산 학습에서 데이터 분포(i.i.d. 대비 비i.i.i.d.)가 모델 성능에 미치는 영향을 조사하기 위해.
  • DP-FL 환경에서 다양한 비밀성 예산(ε) 설정이 모델 정확도 및 수렴에 미치는 영향을 평가하기 위해.
  • 실제로 자주 사용되는 작은, 현실적인 의료 데이터셋에 대해 DP-FL 적용의 가능성을 평가하기 위해.
  • 크로스실 분산 학습 환경에서 비밀성(DP)과 모델 유틸리티 간의 성능 트레이드오프를 규명하기 위해.

제안 방법

  • 클라이언트 간 모델 집계를 통해 중심화된 분산 학습을 위해 FedAvg 알고리즘을 사용함.
  • PyTorch의 Opacus 라이브러리를 활용해 기울기 편향을 통한 비밀성 보장 기법을 적용하고, 적응형 복합 및 기울기 클리핑을 수행함.
  • 각 라운드에 고정된 비밀성 예산을 사용하여 전체 (ε, δ)-비밀성 보장 확보를 위해 ε를 훈련 라운드에 나누어 적용함.
  • MNIST, FEMNIST 및 작은 의료 데이터셋에서 다양한 수의 클라이언트와 ε 값으로 합성곱 신경망(CNN)을 훈련함.
  • 다양한 설정에서 훈련 라운드 동안 테스트 정확도와 손실을 측정하여 모델 성능을 평가함.
  • 실제 데이터 이질성을 시뮬레이션하기 위해 FEMNIST에 대해 작성자 식별자를 기반으로 비i.i.d. 분할 전략을 사용함.
(a) Accuracy and loss for different numbers of clients.
(a) Accuracy and loss for different numbers of clients.

실험 결과

연구 질문

  • RQ1비밀성 보장이 있는 분산 학습(DP-FL)에서 데이터의 비i.i.d. 분포가 모델 수렴 및 정확도에 어떤 영향을 미치는가?
  • RQ2비밀성 예산 ε를 다양하게 설정할 경우, 비밀성 보장이 있는 분산 학습에서 모델 성능에 어떤 영향을 미치는가?
  • RQ3작고 현실적인 의료 데이터셋에서 DP-FL이 수용 가능한 모델 유틸리티를 달성할 수 있는가?
  • RQ4크로스실 분산 학습 환경에서 비밀성(DP)과 모델 유틸리티(정확도) 간의 트레이드오프는 어떠한가?

주요 결과

  • i.i.d. 데이터를 사용한 MNIST에서는 비밀성 보장이 적용된 경우 정확도가 95% 이상에서 약 75%로 떨어지며, ε=100일 때도 약 20%의 성능 저하가 발생함.
  • 비i.i.d. 데이터를 사용한 FEMNIST에서는 DP 적용으로 인해 훈련 과정이 수렴하지 못했으며, 높은 클라이언트 수에도 불구하고 모델 유틸리티가 열악함.
  • 작은 의료 데이터셋에서는 클라이언트 수가 많아질수록 정확도의 변동성이 증가했으며, DP 적용으로 정확도 향상은 없었고, ε=10일 때만 손실 감소가 약간 관찰됨.
  • 비i.i.d. 데이터 및 작은 데이터셋에서 성능 저하가 가장 심각했으며, 이는 DP 메커니즘이 학습을 심각하게 방해했기 때문임.
  • 큰 비밀성 예산(ε=100)을 사용한 경우에도 비공개 모델 수준의 정확도로 회복되지 않았으며, 이는 근본적인 트레이드오프를 시사함.
  • 표준 ε 값(예: 0.1)은 작은 데이터셋에 너무 엄격하여 훈련 진행을 가능하게 하기 위해 더 큰 ε가 필요함.
(b) Accuracy and loss for different values of $\epsilon$ , with 10 clients.
(b) Accuracy and loss for different values of $\epsilon$ , with 10 clients.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.