Skip to main content
QUICK REVIEW

[논문 리뷰] Fingerprinting Codes and the Price of Approximate Differential Privacy

Mark Bun, Jonathan Ullman|arXiv (Cornell University)|2013. 11. 13.
Privacy-Preserving Technologies in Data참고 문헌 23인용 수 4
한 줄 요약

이 논문은 $(\varepsilon,\delta)$-차별적 비밀유지 알고리즘으로 대규모 카운팅 쿼리 집합에 정확하게 응답하기 위해 필요한 표본 복잡도에 대한 엄밀한 정보이론적 하한을 설정한다. 약간의 차별적 비밀유지의 가격이 순수 정확도 요구사항보다 점점 더 크게 되며, $\tilde{\Omega}\left(\frac{\sqrt{d}\log|\mathcal{Q}|}{\alpha^2\varepsilon}\right)$의 하한을 증명함으로써, 이는 최고의 알려진 상한과 로그 인자 수준에서 일치한다.

ABSTRACT

We show new lower bounds on the sample complexity of $(\varepsilon, δ)$-differentially private algorithms that accurately answer large sets of counting queries. A counting query on a database $D \in (\{0,1\}^d)^n$ has the form "What fraction of the individual records in the database satisfy the property $q$?" We show that in order to answer an arbitrary set $\mathcal{Q}$ of $\gg nd$ counting queries on $D$ to within error $\pm α$ it is necessary that $$ n \geq ildeΩ\Bigg(\frac{\sqrt{d} \log |\mathcal{Q}|}{α^2 \varepsilon} \Bigg). $$ This bound is optimal up to poly-logarithmic factors, as demonstrated by the Private Multiplicative Weights algorithm (Hardt and Rothblum, FOCS'10). In particular, our lower bound is the first to show that the sample complexity required for accuracy and $(\varepsilon, δ)$-differential privacy is asymptotically larger than what is required merely for accuracy, which is $O(\log |\mathcal{Q}| / α^2)$. In addition, we show that our lower bound holds for the specific case of $k$-way marginal queries (where $|\mathcal{Q}| = 2^k \binom{d}{k}$) when $α$ is not too small compared to $d$ (e.g. when $α$ is any fixed constant). Our results rely on the existence of short \emph{fingerprinting codes} (Boneh and Shaw, CRYPTO'95, Tardos, STOC'03), which we show are closely connected to the sample complexity of differentially private data release. We also give a new method for combining certain types of sample complexity lower bounds into stronger lower bounds.

연구 동기 및 목표

  • $(\varepsilon,\delta)$-차별적 비밀유지 알고리즘이 대규모 카운팅 쿼리 가족에 정확하게 응답하기 위해 필요한 최소 표본 복잡도를 규명하는 것.
  • 차별적 비밀유지의 가격이 순수 정확도 요구사항보다 점점 더 크게 되는 것을 입증하는 것.
  • 피어프린팅 코드가 비밀유지 데이터 공개의 표본 복잡도와 본질적으로 연결되어 있음을 보여주는 것.
  • 약간의 차별적 비밀유지 하에서 $k$-웨이 마진 쿼리와 일반적인 카운팅 쿼리 가족에 대해 엄밀한 하한을 증명하는 것.

제안 방법

  • 특정 강건성 성질을 갖는 짧은 피어프린팅 코드의 존재로 비밀유지 쿼리 공개 문제를 축소하는 것.
  • 다른 쿼리 가족에서 유도된 하한을 조합하여 더 강력한 종합 하한을 만드는 새로운 복합 정리의 사용.
  • 약한 강건성 특성을 갖는 피어프린팅 코드(특히 Tardos 코드)를 적용하고, 확률적 및 농도 분석을 통해 그 강건성을 증명하는 것.
  • 전체 강건성에서 약한 강건성으로의 감소를 통해 표본 복잡도 하한을 확립하는 것.
  • 에러 확률을 제어하기 위해 마르코프 부등식과 이항 및 삼각적 적분의 尾부 경계를 사용하는 것.
  • 피어프린팅 코드와 쿼리 가족의 VC-차원 간의 연결을 활용하여 정보이론적 한계를 도출하는 것.

실험 결과

연구 질문

  • RQ1$(\varepsilon,\delta)$-차별적 비밀유지 알고리즘이 $|\mathcal{Q}|$개의 카운팅 쿼리에 대해 오차 $\pm\alpha$ 이내로 정확하게 응답하기 위해 필요한 최소 표본 크기는 얼마인가요?
  • RQ2$(\varepsilon,\delta)$-차별적 비밀유지 요구사항은 정확한 통계적 추정에 필요한 표본 복잡도를 초월해 점점 더 큰 비용을 부과하는가요?
  • RQ3피어프린팅 코드는 차별적 비밀유지 데이터 공개의 표본 복잡도와 어떻게 관련되어 있나요?
  • RQ4쿼리 가족의 구조적 특성(예: $k$-웨이 마진)을 이용해 표본 복잡도 하한을 향상 또는 강화할 수 있나요?
  • RQ5Private Multiplicative Weights 알고리즘의 표본 복잡도는 로그 인자 수준에서 최적이며, 이는 하한의 엄밀함을 확인하는가?

주요 결과

  • $(\varepsilon,\delta)$-차별적 비밀유지로 $|\mathcal{Q}|$개의 카운팅 쿼리를 공개하기 위한 표본 복잡도는 최소 $\tilde{\Omega}\left(\frac{\sqrt{d}\log|\mathcal{Q}|}{\alpha^2\varepsilon}\right)$이며, 이는 다항로그 인자 수준에서 엄밀하다.
  • 이 하한은 비밀유지 없이 정확한 추정에 필요한 $O(\log|\mathcal{Q}|/\alpha^2)$ 표본 복잡도보다 엄격히 크며, 차별적 비밀유지의 비용이 비현실적이지 않음을 입증한다.
  • $k$-웨이 마진 쿼리의 경우 $|\mathcal{Q}| = 2^k \binom{d}{k}$이면, $\alpha$가 상수일 때 하한은 $\Omega(\sqrt{d}/\alpha^2\varepsilon)$이며, $\alpha$가 작을 경우 $\Omega(k/\varepsilon)$가 된다.
  • Tardos의 피어프린팅 코드가 약한 강건성을 갖는 것으로 밝혀졌으며, 이 성질은 전체 강건성으로의 감소를 통해 강력한 하한을 도출하는 데 사용된다.
  • 분석을 통해 랜덤하게 생성된 Tardos 코드북은 $\Omega(n^{3/2}\log(n/\xi))$개의 표시된 열을 포함하고 있으며, 이는 하한 구성에 필수적이다.
  • 이 논문은 Private Multiplicative Weights 알고리즘이 로그 인자 수준에서 최적의 표본 복잡도를 달성하며, 하한의 엄밀함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.