Skip to main content
QUICK REVIEW

[논문 리뷰] On Sampling, Anonymization, and Differential Privacy: Or, k-Anonymization Meets Differential Privacy

Ninghui Li, Wahbeh Qardaji|arXiv (Cornell University)|2011. 01. 13.
Privacy-Preserving Technologies in Data참고 문헌 29인용 수 19
한 줄 요약

이 논문은 무작위 표본 추출 단계 이후에 안전하게 적용된 k-익명성 기법이 합리적인 매개수를 갖는 (ε,δ)-차별적 프라이버시를 만족함을 입증한다. 표본 추출이 공격자에 대한 불확실성을 유도함으로써 안전한 k-익명성 기법이 공식적인 프라이버시 보장을 제공할 수 있으며, 표본 추출이 차별적 프라이버시 알고리즘에서 프라이버시 보호를 강화함을 보여준다.

ABSTRACT

This paper aims at answering the following two questions in privacy-preserving data analysis and publishing: What formal privacy guarantee (if any) does $k$-anonymization provide? How to benefit from the adversary's uncertainty about the data? We have found that random sampling provides a connection that helps answer these two questions, as sampling can create uncertainty. The main result of the paper is that $k$-anonymization, when done "safely", and when preceded with a random sampling step, satisfies $(ε,δ)$-differential privacy with reasonable parameters. This result illustrates that "hiding in a crowd of $k$" indeed offers some privacy guarantees. This result also suggests an alternative approach to output perturbation for satisfying differential privacy: namely, adding a random sampling step in the beginning and pruning results that are too sensitive to change of a single tuple. Regarding the second question, we provide both positive and negative results. On the positive side, we show that adding a random-sampling pre-processing step to a differentially-private algorithm can greatly amplify the level of privacy protection. Hence, when given a dataset resulted from sampling, one can utilize a much large privacy budget. On the negative side, any privacy notion that takes advantage of the adversary's uncertainty likely does not compose. We discuss what these results imply in practice.

연구 동기 및 목표

  • 공격자에 대한 불확실성이 존재하는 상황에서 k-익명성이 공식적인 프라이버시 보장을 제공하는지 여부를 규명하는 것.
  • 랜덤 샘플링을 통해 모델링된 공격자 불확실성이 차별적 프라이버시를 완화하는 데 활용될 수 있는지 탐색하는 것.
  • k-익명성이 안전하게 적용되어 차별적 프라이버시를 달성할 수 있는 조건을 특정하는 것.
  • 공격자 불확실성에 기반한 프라이버시 개념의 복합성 및 실용적 함의를 조사하는 것.

제안 방법

  • 기존 k-익명성 기법에서 알려진 프라이버시 취약점을 피하는 '안전한' k-익명성 알고리즘을 도입한다.
  • 두 단계 파ip라인을 제안한다: 먼저 데이터셋에 대해 랜덤 샘플링을 적용한 후, 안전한 k-익명성 알고리즘을 적용한다.
  • 이 파이프라인의 (ε,δ)-차별적 프라이버시가 합리적인 ε 및 δ 매개수로 만족됨을 증명한다.
  • 표본 추출이 개인 데이터 존재 여부에 대한 공격자 불확실성을 증가시켜 프라이버시를 강화하는 방식을 분석한다.
  • 표본 추출이 차별적 프라이버시 알고리즘에서 더 높은 프라이버시 예산을 가능하게 함을 시연한다.
  • 이론적 분석을 통해 공격자 불확실성에 기반한 프라이버시 개념은 일반적으로 다중 쿼리에서 복합되지 않는다는 것을 보여준다.

실험 결과

연구 질문

  • RQ1k-익명성 기법이 랜덤 샘플링과 결합되었을 때 어떤 공식적인 프라이버시 보장을 제공하는가?
  • RQ2표본 추출에 의해 유도된 공격자 불확실성이 강력한 프라이버시 성질을 유지하면서 차별적 프라이버시를 완화하는 데 사용될 수 있는가?
  • RQ3표본 추출 이후 k-익명성이 어떤 조건에서 차별적 프라이버시를 만족하는가?
  • RQ4표본 추출이 차별적 프라이버시 알고리즘의 프라이버시 예산과 오차 내성에 어떤 영향을 미치는가?
  • RQ5공격자 불확실성에 기반한 프라이버시 개념은 다중 쿼리에서 복합되는가?

주요 결과

  • 안전한 k-익명성 기법이 랜덤 샘플링 이후 적용될 경우, 합리적인 ε 및 δ 매개수를 갖는 (ε,δ)-차별적 프라이버시를 만족한다.
  • 랜덤 표본 추출은 공격자에게 의미 있는 불확실성을 유도하며, 이를 통해 프라이버시 보장을 강화할 수 있다.
  • 표본 추출 단계 덕분에 k-익명성 기법을 차별적 프라이버시 프레임워크에 적용할 수 있게 되었으며, k-익명성 기법만으로는 차별적 프라이버시를 보장하지 못한다.
  • 표본 추출은 프라이버시 보호를 강화한다: 차별적 프라이버시 알고리즘 이전에 적용될 경우 더 큰 프라이버시 예산을 허용한다.
  • 공격자 불확실성에 기반한 프라이버시 개념, 예를 들어 표본 추출에 기반한 개념들은 일반적으로 다중 쿼리에서 복합되지 않는다.
  • 표본 추출을 먼저 수행한 후 k-익명성 기법을 적용하는 방식이, 그 반대 순서보다 프라이버시 강화 및 내성 면에서 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.