Skip to main content
QUICK REVIEW

[논문 리뷰] Private Query Release Assisted by Public Data

Raef Bassily, Albert Cheu|arXiv (Cornell University)|2020. 04. 23.
Privacy-Preserving Technologies in Data참고 문헌 20인용 수 12
한 줄 요약

이 논문은 비밀스러운 데이터와 공개 데이터를 모두 사용하여 미세한 차별적(private) 쿼리 공개를 위한 새로운 프레임워크를 제안한다. 공개 데이터가 비밀스러운 샘플 수를 크게 줄일 수 있음을 보여주며, VC-차원이 $d$이고 이중 VC-차원이 $p$인 임의의 쿼리 클래스에 대해, 공개 샘플 $d/\alpha$개와 비밀스러운 샘플 $\sqrt{p}d^{3/2}/\alpha^2$개로 충분함을 증명한다. 또한, 비밀스러운 샘플 복잡도에 $\sqrt{p}$ 의존성이 필수적임을 확인하는 날카로운 하한선을 제시한다.

ABSTRACT

We study the problem of differentially private query release assisted by access to public data. In this problem, the goal is to answer a large class $\mathcal{H}$ of statistical queries with error no more than $α$ using a combination of public and private samples. The algorithm is required to satisfy differential privacy only with respect to the private samples. We study the limits of this task in terms of the private and public sample complexities. First, we show that we can solve the problem for any query class $\mathcal{H}$ of finite VC-dimension using only $d/α$ public samples and $\sqrt{p}d^{3/2}/α^2$ private samples, where $d$ and $p$ are the VC-dimension and dual VC-dimension of $\mathcal{H}$, respectively. In comparison, with only private samples, this problem cannot be solved even for simple query classes with VC-dimension one, and without any private samples, a larger public sample of size $d/α^2$ is needed. Next, we give sample complexity lower bounds that exhibit tight dependence on $p$ and $α$. For the class of decision stumps, we give a lower bound of $\sqrt{p}/α$ on the private sample complexity whenever the public sample size is less than $1/α^2$. Given our upper bounds, this shows that the dependence on $\sqrt{p}$ is necessary in the private sample complexity. We also give a lower bound of $1/α$ on the public sample complexity for a broad family of query classes, which by our upper bound, is tight in $α$.

연구 동기 및 목표

  • 기본적인 차별적(private) 쿼리 공개의 한계를 해결하기 위해, 간단한 쿼리 클래스조차도 비밀스러운 샘플 수요가 과도하게 많아지는 문제를 해결한다.
  • 공개 데이터가 이용 가능한 완화된 모델에서 비밀스러운 샘플 복잡도와 공개 샘플 복잡도 간의 트레이드오프를 연구한다.
  • 차별적(private) 쿼리 공개의 맥락에서 비밀스러운 데이터와 공개 데이터의 샘플 복잡도에 대해 날카로운 상한선과 하한선을 확립한다.
  • 공개 데이터가 강력한 개인정보 보호 보장을 유지하면서도 비밀스러운 샘플 요구량을 비트리거로 줄일 수 있음을 보여준다.

제안 방법

  • 저자들은 공개 샘플과 비밀스러운 샘플을 조합하여 오차 $\alpha$로 쿼리 평균을 추정하는 PAP (Public-data-Assisted Private) 쿼리 공개 알고리즘을 설계한다.
  • 쿼리 클래스 $\mathcal{H}$ 의 VC-차원 $d$와 이중 VC-차원 $p$ 를 활용하여 샘플 복잡도 한계를 유도한다.
  • 비밀스러운 쿼리 공개를 비밀스러운 학습으로의 감소(reduction)를 통해 분석하며, PAP 쿼리 공개 알고리즘이 유사한 샘플 복잡도를 갖는 PAP 학습기로 이어진다는 것을 보여준다.
  • 핵심 기술적 구성 요소로는 일반적인 쿼리 공개 알고리즘을 입력 도메인에서의 데이터 세트를 출력하는 적절한(Proper) 정제기(sanitizer)로 변환하는 것이다. 이는 정확도와 개인정보 보호를 유지한다.
  • 분석은 이전 연구에서 알려진 하한선에 기반하며, 특히 무한한 Littlestone 차원을 갖는 클래스에 대한 PAP 학습에 관한 것이다.
  • 알고리즘 설계를 통한 상한선과 샘플 복잡도에 대한 정보 이론적 추론을 통한 하한선을 결합하여 날카로운 하한선을 확립한다.

실험 결과

연구 질문

  • RQ1공개 데이터는 차별적(private) 쿼리 공개에 필요한 비밀스러운 샘플 수를 상당히 줄일 수 있는가?
  • RQ2유한한 VC-차원을 갖는 쿼리 클래스에 대해 비밀스러운 샘플 복잡도와 공개 샘플 복잡도 간의 최적 트레이드오프는 무엇인가?
  • RQ3쿼리 클래스의 이중 VC-차원 $p$ 에 따라 비밀스러운 샘플 복잡도에 나타나는 $\sqrt{p}$ 의존성이 필수적인가?
  • RQ4PAP 쿼리 공개에 필요한 최소 공개 샘플 복잡도는 얼마이며, 이는 $\alpha$ 에 대해 날카로운가?
  • RQ5공개 데이터의 사용이, 무한한 쿼리 클래스에 대해 표준 차별적(private) 쿼리 공개가 불가능한 결과를 극복할 수 있는가?

주요 결과

  • VC-차원이 $d$이고 이중 VC-차원이 $p$ 인 임의의 쿼리 클래스에 대해, 공개 샘플 수 $\tilde{O}(d/\alpha)$와 비밀스러운 샘플 수 $\tilde{O}(\sqrt{p}d^{3/2}/\alpha^2)$ 가 충분함을 증명한다.
  • 결정 스텁(Decision Stumps) 클래스에 대해, 공개 샘플 크기가 $1/\alpha^2$ 미만일 경우 비밀스러운 샘플 복잡도에 대해 $\Omega(\sqrt{p}/\alpha)$ 의 하한선을 증명하며, $\sqrt{p}$ 의존성이 필수적임을 보여준다.
  • 넓은 범주에 걸친 쿼리 클래스에 대해 공개 샘플 복잡도에 대해 $\Omega(1/\alpha)$ 의 하한선을 확립하며, 이는 상한선과 일치하여 $\alpha$ 에 대해 날카로운 것을 보여준다.
  • 결과적으로 공개 데이터를 통해 표준 비밀스러운 쿼리 공개 대비 비밀스러운 샘플 복잡도를 거의 제곱근 수준으로 줄일 수 있음을 보여준다.
  • Littlestone 차원이 무한한 클래스, 예를 들어 $\mathbb{R}$ 상의 임계값(thresholds)에 대해, 비밀스러운 샘플이 없더라도 공개 샘플 복잡도는 $\Omega(1/\alpha)$ 가 되어야 하며, 이는 필수적임을 보여준다.
  • 이 프레임워크는 표준 DP 쿼리 공개가 불가능한 클래스에 대해서도 공개 데이터를 통해 비밀스러운 쿼리 공개를 가능하게 함을 보여주며, VC-차원이 1인 경우에도 성립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.