Skip to main content
QUICK REVIEW

[논문 리뷰] On the Benefits of Sampling in Privacy Preserving Statistical Analysis on Distributed Databases

Bing-Rong Lin, Ye Wang|arXiv (Cornell University)|2013. 04. 16.
Privacy-Preserving Technologies in Data참고 문헌 13인용 수 4
한 줄 요약

이 논문은 수직 분할된 분산 데이터베이스에서 차별적 비밀보장과 데이터 기밀성을 확보하기 위해 무작위 표본 추출, 후정규화(Post Randomization, PRAM), 암호화를 활용한 프라이버시 보장 통계 분석 프레임워크를 제안한다. 표본 추출과 PRAM을 조합함으로써 프라이버시를 향상시켜 PRAM 노이즈를 감소시킬 수 있음을 입증하고, 목표 프라이버시 수준 𝜖를 유지하면서 추정 오차를 최소화하는 최적의 표본 크기 𝑚을 도출한다.

ABSTRACT

We consider a problem where mutually untrusting curators possess portions of a vertically partitioned database containing information about a set of individuals. The goal is to enable an authorized party to obtain aggregate (statistical) information from the database while protecting the privacy of the individuals, which we formalize using Differential Privacy. This process can be facilitated by an untrusted server that provides storage and processing services but should not learn anything about the database. This work describes a data release mechanism that employs Post Randomization (PRAM), encryption and random sampling to maintain privacy, while allowing the authorized party to conduct an accurate statistical analysis of the data. Encryption ensures that the storage server obtains no information about the database, while PRAM and sampling ensures individual privacy is maintained against the authorized party. We characterize how much the composition of random sampling with PRAM increases the differential privacy of system compared to using PRAM alone. We also analyze the statistical utility of our system, by bounding the estimation error - the expected l2-norm error between the true empirical distribution and the estimated distribution - as a function of the number of samples, PRAM noise, and other system parameters. Our analysis shows a tradeoff between increasing PRAM noise versus decreasing the number of samples to maintain a desired level of privacy, and we determine the optimal number of samples that balances this tradeoff and maximizes the utility. In experimental simulations with the UCI "Adult Data Set" and with synthetically generated data, we confirm that the theoretically predicted optimal number of samples indeed achieves close to the minimal empirical error, and that our analytical error bounds match well with the empirical results.

연구 동기 및 목표

  • 개인 프라이버시를 보장하면서 수직 분할된 분산 데이터베이스에서 정확한 통계 분석을 수행하는 데 도전 과제를 해결한다.
  • 암호화를 통해 신뢰할 수 없는 서버가 원래 데이터에 대한 정보를 유추하지 못하도록 보장한다.
  • 표본 추출을 통해 노이즈 요구량을 줄임으로써 승인된 분석가에 대한 개인 프라이버시를 보호하기 위해 후정규화(POST RANDOMIZATION, PRAM)를 사용한다.
  • 무작위 표본 추출과 PRAM을 조합함으로써 얻는 프라이버시 이점을 특성화하여, PRAM 단독 사용보다 더 높은 차별적 비밀보장을 달성함을 보여준다.
  • 고정된 프라이버시 예산 𝜖를 기준으로 추정 오차를 최소화하는 최적의 표본 수 𝑚을 도출함으로써 프라이버시와 통계 유틸리티 사이의 트레이드오프를 최적화한다.

제안 방법

  • 승인된 분석가에 대한 차별적 비밀보장을 확보하기 위해 개인 데이터 항목을 흐리게 하는 후정규화(POST RANDOMIZATION, PRAM)를 적용한다.
  • PRAM 적용 이전에 전체 데이터베이스에서 랜덤 표본을 추출하여 효과적인 노이즈 요구량을 감소시킨다.
  • 신뢰할 수 없는 서버로의 전송 전에 데이터에 일회용 패드 암호화를 적용하여 서버가 원래 데이터에 대한 정보를 추론하지 못하도록 보장한다.
  • PRAM에 대해 𝛾-대각선 전이 행렬 A를 정식화하여, 𝛾가 흐릿함 수준과 프라이버시 수준을 제어하도록 한다.
  • 표본 크기 𝑚과 PRAM 매개변수 𝛾에 따라 진짜 연합 유형 분포와 추정된 연합 유형 분포 간의 기대 ℓ₂-노름 추정 오차에 대한 이론적 경계를 유도한다.
  • 고정된 프라이버시 예산 𝜖 하에서 유도된 오차 경계를 최소화함으로써 표본 크기 𝑚을 최적화하고, 최적의 𝑚에 대한 닫힌 형태의 표현식을 도출한다.

실험 결과

연구 질문

  • RQ1무작위 표본 추출과 PRAM을 조합할 경우, PRAM 단독 사용 대비 차별적 비밀보장이 어떻게 향상되는가?
  • RQ2목표 프라이버시 수준 𝜖를 유지하면서 추정 오차를 최소화하는 최적의 표본 수 𝑚은 얼마인가?
  • RQ3PRAM 흐릿함 매개변수 𝛾의 선택이 프라이버시와 통계 유틸리티 사이의 트레이드오프에 미치는 영향은 무엇인가?
  • RQ4실제 데이터 분포 하에서 ℓ₂-노름 추정 오차에 대한 이론적 경계가 실증적으로 검증될 수 있는가?
  • RQ5동일한 프라이버시 수준에서 비표본화 접근 방식 대비 제안된 시스템이 PRAM 노이즈 요구량을 얼마나 줄이는가?

주요 결과

  • 무작위 표본 추출과 PRAM의 조합은 시스템의 차별적 비밀보장을 향상시켜 동일한 프라이버시 예산 𝜖에서 PRAM 노이즈를 감소시킬 수 있다.
  • 추정 오차를 최소화하는 최적의 표본 크기 𝑚는 𝑚 = 𝑛(𝑒^𝜖 - 1)/(𝛾 - 1 + |𝒳||𝒴|)로 도출되며, 여기서 𝑛은 전체 데이터베이스 크기이다.
  • 기대 ℓ₂-노름 추정 오차에 대한 이론적 경계는 𝐸[‖𝑇̂ - 𝑇‖₂] ≤ (𝑐√|𝒳||𝒴| + 1)/√𝑚 이며, 여기서 𝑐 = 1 + |𝒳||𝒴|/(𝛾 - 1) 는 PRAM 행렬의 조건수이다.
  • 유도된 최적의 𝑚는 UCI Adult 데이터셋과 합성 데이터를 사용한 시뮬레이션에서 실제 오차에 매우 가까운 최소값을 달성하여 이론적 예측을 확인한다.
  • 프라이버시 경계는 날카롭다: 정리 III.2에서 𝜖 값은 더 이상 줄일 수 없으며, 정확히 비율 𝑒^𝜖를 달성하는 예시로 이를 입증한다.
  • 일회용 패드 암호화를 통해 신뢰할 수 없는 서버에 대해 정보 이론적 보안을 달성하여 원본 데이터의 泄露가 없음을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.