Skip to main content
QUICK REVIEW

[논문 리뷰] Individual Privacy Accounting for Differentially Private Stochastic Gradient Descent

Yu Da, Gautam Kamath|arXiv (Cornell University)|2022. 06. 06.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 차등적 보장이 있는 확률적 경사 하강법(DP-SGD)에서 개별 예측의 개인 정보 보호 수준을 정량화하기 위해 출력 특화 $(\varepsilon,\delta)$-차등적 보장(Privacy)을 도입한다. 이는 높은 학습 손실을 보이는 예제들이 훨씬 더 약한 개인 정보 보호를 경험한다는 것을 보여주며, 개별 개인 정보 보호를 추정하기 위한 효율적인 알고리즘을 제안한다. 이 알고리즘은 모델의 유용성이 떨어지는 그룹일수록 개인 정보 보호 수준도 열 劣하다는 것을 드러내며, CIFAR-10에서 가장 낮은 정확도 클래스의 $\varepsilon$가 최대 44.2% 높아짐을 확인한다.

ABSTRACT

Differentially private stochastic gradient descent (DP-SGD) is the workhorse algorithm for recent advances in private deep learning. It provides a single privacy guarantee to all datapoints in the dataset. We propose output-specific $(\varepsilon,δ)$-DP to characterize privacy guarantees for individual examples when releasing models trained by DP-SGD. We also design an efficient algorithm to investigate individual privacy across a number of datasets. We find that most examples enjoy stronger privacy guarantees than the worst-case bound. We further discover that the training loss and the privacy parameter of an example are well-correlated. This implies groups that are underserved in terms of model utility simultaneously experience weaker privacy guarantees. For example, on CIFAR-10, the average $\varepsilon$ of the class with the lowest test accuracy is 44.2\% higher than that of the class with the highest accuracy.

연구 동기 및 목표

  • 기본적인 DP-SGD가 모든 예제에 대해 동일한 최악의 경우 개인 정보 보호 한계를 부여함에 따라 발생하는 한계를 해결하기 위해.
  • 실제 학습 경로에 기반해 최악의 경우 가정이 아닌, 개인 맞춤형 개인 정보 보호 보장을 계산하는 방법을 개발하기 위해.
  • DP-SGD로 훈련된 기계 학습 모델에서 개인 정보 보호 격차가 모델 유용성 격차와 일치하는지 조사하기 위해.
  • 개별 개인 정보 보호 회계가 개인 정보 보호와 공정성의 상호 작용에 미치는 영향을 탐색하기 위해.

제안 방법

  • 각 예제의 관측된 학습 경로에 따라 달라지는 출력 특화 $(\varepsilon,\delta)$-차등적 보장(Privacy)을 정교화된 개인 정보 보호 개념으로 제안한다.
  • 학습 경로 동안의 기울기 노름과 노이즈 기여도를 분석하여, 개별 개인 정보 보호 파라미터를 추정하는 효율적인 알고리즘을 설계한다.
  • 개별 개인 정보 보호 파라미터와 최종 학습 손실의 로그 간 상관관계를 모델링하기 위해 로그 적합 기법을 활용한다.
  • 실제로 학습 중에 관측된 기울기 크기를 활용해, 개인 예제용으로 수정된 모멘트 회계 프레임워크를 적용한다.
  • CIFAR-10, MNIST, UTKFace와 같은 여러 벤치마크 데이터셋에 이 방법을 적용하여 예제별 개인 정보 보호를 실증적으로 평가한다.
  • 멤버십 유추 공격을 사용하여 높은 $\varepsilon$가 높은 실질적 개인 정보 보호 위험과 관련이 있음을 확인함으로써 결과를 검증한다.

실험 결과

연구 질문

  • RQ1DP-SGD 학습 중 개별 예제들이 동일한 개인 정보 보호 보장을 받는가, 아니면 더 작은 기울기 노름으로 인해 일부 예제가 더 강한 개인 정보 보호를 누리는가?
  • RQ2예제의 최종 학습 손실과 그 개별 개인 정보 보호 파라미터 $\varepsilon$ 사이에 측정 가능한 상관관계가 있는가?
  • RQ3모델 유용성 측면에서 성능이 열 劣한 그룹도 DP-SGD 하에서 더 약한 개인 정보 보호 보장을 경험하는가?
  • RQ4개별 개인 정보 보호 회계는 최악의 경우 DP 한계가 포착하지 못한 숨겨진 공정성 격차를 드러낼 수 있는가?
  • RQ5개별 개인 정보 보호 파라미터의 도입이 데이터 삭제를 지원하는 시스템을 포함한 실세계의 개인 정보 보호와 공정성에 어떤 영향을 미치는가?

주요 결과

  • CIFAR-10에서 가장 낮은 테스트 정확도를 보인 '고양이' 클래스의 평균 $\varepsilon$는 가장 높은 정확도를 가진 '자동차' 클래스보다 44.2% 높았다.
  • UTKFace-Gender에서 가장 낮은 테스트 정확도를 보인 '아시아' 그룹의 평균 $\varepsilon$는 가장 높은 정확도를 가진 '인도' 그룹보다 35.1% 높았다.
  • 모든 데이터셋에서 개인 정보 보호 파라미터와 최종 학습 손실의 로그 간 강력한 로그 상관관계(Pearson 상관계수 > 0.9)를 발견하였다.
  • 더 높은 학습 손실을 보이는 예제의 개인 정보 보호 파라미터 $\varepsilon$는 일관되게 더 높았으며, 이는 잘 학습되지 않은 예제들이 더 큰 개인 정보 보호 위험에 노출되어 있음을 시사한다.
  • 모델 유용성이 열 劣한 그룹도 개인 정보 보호 보장이 열 劣하여, 공정성과 개인 정보 보호 양측에 동시에 격차가 존재한다는 점이 드러났다.
  • 멤버십 유추 공격를 통해 높은 $\varepsilon$ 값이 높은 실질적 개인 정보 보호 위험과 관련이 있음을 확인하여, 개인 정보 보호 회계의 실용적 관련성을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.