Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian Pseudo Posterior Mechanism under Asymptotic Differential Privacy

Terrance D. Savitsky, Matthew R. Williams|arXiv (Cornell University)|2019. 09. 25.
Privacy-Preserving Technologies in Data참고 문헌 16인용 수 8
한 줄 요약

이 논문은 데이터 기록 색인 기반 가중치를 통해 고위험 기록을 정교하게 가중치를 낮추어 점점 더 작은 위험으로 수렴하는 점근적 비차별적 프라이버시 하에서 합성 데이터의 유틸리티를 향상시키는 베이지안 가짜 사후 메커니즘을 제안한다. 이는 지수 기반 메커니즘보다 더 높은 유틸리티를 달성하면서도 $(\epsilon,\pi)$-확률적 비차별적 프라이버시를 보장한다. $\pi$는 점점 더 0으로 수렴한다.

ABSTRACT

We propose a Bayesian pseudo posterior mechanism to generate record-level synthetic databases equipped with an $(ε,δ)-$ probabilistic differential privacy (pDP) guarantee, where $δ$ denotes the probability that any observed database exceeds $ε$. The pseudo posterior mechanism employs a data record-indexed, risk-based weight vector with weight values $\in [0, 1]$ that surgically downweight the likelihood contributions for high-risk records for model estimation and the generation of record-level synthetic data for public release. The pseudo posterior synthesizer constructs a weight for each data record using the Lipschitz bound for that record under a log-pseudo likelihood utility function that generalizes the exponential mechanism (EM) used to construct a formally private data generating mechanism. By selecting weights to remove likelihood contributions with non-finite log-likelihood values, we guarantee a finite local privacy guarantee for our pseudo posterior mechanism at every sample size. Our results may be applied to \emph{any} synthesizing model envisioned by the data disseminator in a computationally tractable way that only involves estimation of a pseudo posterior distribution for parameters, $θ$, unlike recent approaches that use naturally-bounded utility functions implemented through the EM. We specify mild conditions that guarantee the asymptotic contraction of $δ$ to $0$ over the space of databases. We illustrate our pseudo posterior mechanism on the sensitive family income variable from the Consumer Expenditure Surveys database published by the U.S. Bureau of Labor Statistics. We show that utility is better preserved in the synthetic data for our pseudo posterior mechanism as compared to the EM, both estimated using the same non-private synthesizer, due to our use of targeted downweighting.

연구 동기 및 목표

  • 형식적인 프라이버시 보장을 갖는 기록 수준의 합성 데이터베이스를 생성하기 위한 계산적으로 타당한 방법을 개발하는 것.
  • 합성 데이터 생성에서 프라이버시와 유틸리티의 상호 갈등을 해결하기 위해 고위험 기록에만 특정하게 가중치를 낮추는 방법을 제공하는 것.
  • 표본 크기가 증가함에 따라 $\pi$가 0으로 수렴하는 점근적 $(\epsilon,\pi)$-확률적 비차별적 프라이버시 보장을 제공하는 것.
  • 핵심 샘플링 절차를 변경하지 않고도 비공개 합성기 모델을 공식적 프라이버시 메커니즘으로 확장하는 것.
  • 비유한 로그우도 값 기여를 제거하여 모든 표본 크기에서 유한한 국소 프라이버시 보장을 보장하는 것.

제안 방법

  • 고위험 기록의 우도 기여도를 낮추기 위해 데이터 기록 색인 기반 가중치 벡터 $\bm{\alpha} \in [0,1]^n$ 를 구성한다.
  • 국소 리프시츠 경계 $\Delta_{\bm{\alpha},\mathbf{x}}$ 를 계산하기 위해 로그가짜우도 유틸리티 함수를 사용하여 각 기록에 대해 프라이버시 정량화를 가능하게 한다.
  • 가중치 분포에 스케일링($c<1$)과 이동($g<0$)을 적용한 후, 모든 가중치가 $[0,1]$ 범위에 유지되도록 잘라내기 처리를 한다.
  • 매개변수 추정을 위해 가짜 사후 분포 $p(\theta \mid \mathbf{x}, \bm{\alpha}) \propto \prod_{i=1}^n f_\theta(x_i)^{\alpha_i} \times p(\theta)$ 를 활용한다.
  • 잘라내기 규칙을 도입: $\alpha^*_i = 0$ 이면 $\alpha_i \times f_\theta(x_i) > M$ 이고, $M$ 은 전역 수축점이다.
  • 국소 프라이버시 보장을 $\epsilon_{\mathbf{x}} = 2 \times \Delta_{\bm{\alpha},\mathbf{x}} \times m$ 로 유도하며, $m=20$ 은 합성 데이터베이스를 위한 사후 샘플링 수이다.

실험 결과

연구 질문

  • RQ1형식적 프라이버시 보장을 제공하면서도 기존 방법보다 더 높은 데이터 유틸리티를 유지하는 가짜 사후 메커니즘을 구성할 수 있는가?
  • RQ2기록별 위험을 어떻게 정량화하고, 이를 통해 계산적으로 타당한 방식으로 고위험 기록만을 특별히 가중치를 낮출 수 있는가?
  • RQ3어떤 조건이 $\epsilon$ 을 초과하는 어떤 데이터베이스의 확률 $\pi$ 가 점점 0으로 수렴하도록 보장하는가?
  • RQ4지수 기반 메커니즘에서 사용하는 스칼라 가중치 낮추기 방식에 비해, 고위험 기록에 대한 표적적 가중치 낮추기가 유틸리티에 얼마나 더 효과적인가?
  • RQ5제안된 메커니즘은 후보 사후 샘플링 절차를 수정하지 않고도 어떤 비공개 합성기 모델에나 적용할 수 있는가?

주요 결과

  • $\bm{\alpha}$-가중치 가짜 사후 메커니즘은 구성에 관계없이 국소 프라이버시 보장($\Delta_{\bm{\alpha},\mathbf{x}}$)을 80% 감소시켰다. 비가중치 기준 78.7에서 가중치 적용 후 2.25로 감소하였다.
  • 가짜 사후 메커니즘 하에서 합성 소득 값의 90번째 백분율은 모든 $(c,g)$ 구성에서 지수 기반 메커니즘보다 훨씬 평탄한 악화 경향을 보였다.
  • 비유한 로그우도 기여를 제거함으로써 모든 표본 크기에서 유한한 국소 프라이버시 보장을 보장한다.
  • 표본 크기가 증가함에 따라 $\epsilon$ 을 초과하는 확률 $\pi$ 는 점점 0으로 수렴하여 $(\epsilon,\pi)$-확률적 비차별적 프라이버시 보장을 만족한다.
  • 균일한 스케일링이 아닌 고위험 기록에만 정교하게 가중치를 낮추므로 지수 기반 메커니즘보다 유틸리티가 더 효과적으로 유지된다.
  • 이 방법은 비공개 합성기 모델을 후보 사후 샘플링 절차를 최소한으로 수정함으로써 공식적 프라이버시 메커니즘으로 변환할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.