Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian Estimation of Differential Privacy

Santiago Zanella-Béguelin, Lukas Wutschitz|arXiv (Cornell University)|2022. 06. 10.
Privacy-Preserving Technologies in Data인용 수 10
한 줄 요약

이 논문은 기계학습에서 차등적 프라이버시(DP) 예산을 추정하기 위한 새로운 베이지안 방법을 제안한다. 멤버십 인식 공격에서 거짓 양성 및 거짓 음성 비율의 결합 사후분포를 활용하여 ε에 대한 훨씬 더 날카운 가용성 구간을 도출한다. 이 방법은 이전 방법에 비해 샘플 수를 최대 40% 감소시키며, 레이블 전용 DP에서 유래한 히우리스틱을 응용하여 모델당 다수의 샘플을 생성함으로써 계산 비용을 최대 두 자릿수 감소시킨다.

ABSTRACT

Algorithms such as Differentially Private SGD enable training machine learning models with formal privacy guarantees. However, there is a discrepancy between the protection that such algorithms guarantee in theory and the protection they afford in practice. An emerging strand of work empirically estimates the protection afforded by differentially private training as a confidence interval for the privacy budget $\varepsilon$ spent on training a model. Existing approaches derive confidence intervals for $\varepsilon$ from confidence intervals for the false positive and false negative rates of membership inference attacks. Unfortunately, obtaining narrow high-confidence intervals for $ε$ using this method requires an impractically large sample size and training as many models as samples. We propose a novel Bayesian method that greatly reduces sample size, and adapt and validate a heuristic to draw more than one sample per trained model. Our Bayesian method exploits the hypothesis testing interpretation of differential privacy to obtain a posterior for $\varepsilon$ (not just a confidence interval) from the joint posterior of the false positive and false negative rates of membership inference attacks. For the same sample size and confidence, we derive confidence intervals for $\varepsilon$ around 40% narrower than prior work. The heuristic, which we adapt from label-only DP, can be used to further reduce the number of trained models needed to get enough samples by up to 2 orders of magnitude.

연구 동기 및 목표

  • 이론적 DP 보장과 실질적 프라이버시 보호 사이의 격차를 해소하기 위해.
  • 기존 방법이 거짓 양성 및 거짓 음성 비율에 대해 별도의 Clopper-Pearson 신뢰구간을 사용하여 큰 샘플 수가 필요하고 넓은 구간을 초래하는 한계를 극복하기 위해.
  • 독립적으로 훈련된 모델의 수를 줄여서 경험적 DP 추정의 계산 비용을 감소시키기 위해, 모델당 다수의 샘플을 생성하는 데 사용되는 히우리스틱을 응용한다.
  • 실제 기계학습 파이프라인에서 효과적인 프라이버시 예산(ε)의 더 정확하고 신뢰할 수 있는 추정을 제공하기 위해.
  • 다양한 모델 유형과 프라이버시 영역(비-DP 모델 포함)에서 적응된 히우리스틱의 정밀도를 검증하기 위해.

제안 방법

  • 멤버십 인식 공격에서 거짓 양성 및 거짓 음성 비율의 결합 사후분포를 베이지안 추론을 통해 모델링한다.
  • 차등적 프라이버시의 가설 검정 해석을 활용하여 공격 비율의 결합 사후분포에서 ε에 대한 사후분포를 유도한다.
  • 유도된 사후분포를 기반으로 ε에 대한 신뢰구간을 적용하여, 빈도주의 신뢰구간보다 더 날카운 불확실성 정량화를 가능하게 한다.
  • 모델당 m > 1개의 멤버십 쿼리를 생성할 수 있도록 레이블 전용 DP에서 유래한 히우리스틱을 응용하고 검증한다. 이는 독립적으로 훈련된 모델의 수를 줄인다.
  • 멤버십 인식 공격에서 모델 종속 손실 임계값을 사용하여 정확도와 계산 비용의 균형을 맞춘다.
  • 다양한 m 값(m = 1, 10, 100, 1000)에 대해 m = 1 기준 대비 추정된 ε의 누적분포함수(CDF)를 비교하여 히우리스틱의 성능을 검증한다.

실험 결과

연구 질문

  • RQ1거짓 양성 및 거짓 음성 비율의 결합 분포를 모델링하는 베이지안 접근법이 별도의 신뢰구간보다 ε에 대해 더 날카운 신뢰구간을 제공할 수 있는가?
  • RQ2모델당 다수의 샘플을 생성하는 히우리스틱이 경험적 DP 추정에서 필요로 하는 독립적 훈련 모델의 수를 얼마나 줄일 수 있는가?
  • RQ3DP로 훈련된 모델에 대해 히우리스틱을 적용했을 때 도출된 ε 추정치는 얼마나 정확한가?
  • RQ4이전 방법이 0과 이론적 상한값을 모두 포함하는 구간을 도출하는 영역에서, 이 베이지안 방법은 의미 있는 추정치를 도출할 수 있는가?
  • RQ5다양한 모델 아키텍처와 프라이버시 예산에서 히우리스틱의 성능은 어떻게 변화하는가?

주요 결과

  • 제안된 베이지안 방법은 동일한 샘플 수를 사용할 때 Clopper-Pearson 신뢰구간보다 ε에 대한 신뢰구간을 최대 40% 더 좁게 만든다.
  • 동일한 샘플 수와 신뢰수준에서, 베이지안 접근법은 ε에 대한 추정치를 훨씬 더 정밀하게 도출하여 자원을 더 적게 사용하면서도 더 강력한 프라이버시 결론을 이끌어낼 수 있다.
  • 응용된 히우리스틱은 필요로 하는 독립적 훈련 모델의 수를 최대 두 자릿수 감소시켜 계산 비용을 극적으로 절감한다.
  • DP로 훈련된 모델에 대해 히우리스틱은 정확한 추정치를 도출하며, m = 10일 때는 DP 모델(예: ε = 4인 SST2)에서 m = 1 기준과 가장 유사한 추정치를 얻는다.
  • 비-DP 모델에 대해선 히우리스틱이 m = 1 기준 대비 경험적 DP 경계를 심각하게 과소평가하는 경향이 있어, DP가 적용되지 않은 경우 신뢰도가 낮음을 시사한다.
  • 이전 방법이 0과 이론적 상한값을 모두 포함하는 구간을 도출하는 영역(예: 표 4 참조)에서도 베이지안 방법은 의미 있는 추정치를 도출한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.