[論文レビュー] Private Query Release Assisted by Public Data
この論文は、プライベートデータとパブリックデータの両方を用いた、差分プライバシーのクエリリリースのための新規フレームワークを導入し、パブリックデータがプライベートサンプルの必要数を著しく削減できることを示している。任意のVC次元$d$および双対VC次元$p$をもつクエリクラスに対して、$d/\alpha$個のパブリックサンプルと$\sqrt{p}d^{3/2}/\alpha^2$個のプライベートサンプルで十分であり、$\sqrt{p}$の依存性がプライベートサンプル複雑度において必須であることを裏付けるタイトな下界が確認されている。
We study the problem of differentially private query release assisted by access to public data. In this problem, the goal is to answer a large class $\mathcal{H}$ of statistical queries with error no more than $α$ using a combination of public and private samples. The algorithm is required to satisfy differential privacy only with respect to the private samples. We study the limits of this task in terms of the private and public sample complexities. First, we show that we can solve the problem for any query class $\mathcal{H}$ of finite VC-dimension using only $d/α$ public samples and $\sqrt{p}d^{3/2}/α^2$ private samples, where $d$ and $p$ are the VC-dimension and dual VC-dimension of $\mathcal{H}$, respectively. In comparison, with only private samples, this problem cannot be solved even for simple query classes with VC-dimension one, and without any private samples, a larger public sample of size $d/α^2$ is needed. Next, we give sample complexity lower bounds that exhibit tight dependence on $p$ and $α$. For the class of decision stumps, we give a lower bound of $\sqrt{p}/α$ on the private sample complexity whenever the public sample size is less than $1/α^2$. Given our upper bounds, this shows that the dependence on $\sqrt{p}$ is necessary in the private sample complexity. We also give a lower bound of $1/α$ on the public sample complexity for a broad family of query classes, which by our upper bound, is tight in $α$.
研究の動機と目的
- 標準的な差分プライバシークエリリリースの限界を解決すること。これは、単純なクエリクラスに対しても、実行不可能なほど多くのプライベートサンプルを必要とする。
- パブリックデータが利用可能な緩和されたモデルにおいて、プライベートサンプルとパブリックサンプルの複雑度のトレードオフを調査すること。
- 差分プライバシークエリリリースの文脈において、プライベートデータおよびパブリックデータのサンプル複雑度に対するタイトな上界および下界を確立すること。
- パブリックデータが、強力なプライバシー保証を維持したまま、非自明なプライベートサンプル要件の削減を可能にできることを示すこと。
提案手法
- 著者らは、クエリ平均の推定にパブリックおよびプライベートサンプルを組み合わせるPAP(Public-data-Assisted Private)クエリリリースアルゴリズムを設計した。このアルゴリズムは、誤差$\alpha$を達成する。
- クエリクラス$\mathcal{H}$のVC次元$d$および双対VC次元$p$を活用して、サンプル複雑度バウンドを導出している。
- プライベートクエリリリースからプライベート学習への還元を用いて、PAPクエリリリースアルゴリズムが類似したサンプル複雑度を持つPAPラーナーをもたらすことを示している。
- 主な技術的要素として、一般のクエリリリースアルゴリズムを、入力ドメインからのデータセットを出力する適切な sanitizers に変換する手法を用いている。この変換は、正確性とプライバシーを保持する。
- 分析は、特に無限リトルスタイン次元をもつクラスにおけるPAP学習に関する先行研究の既知の下界に依拠している。
- アルゴリズム的構築による上界と、サンプル複雑度に関する情報理論的議論による下界を組み合わせることで、タイトなバウンドを確立している。
実験結果
リサーチクエスチョン
- RQ1パブリックデータは、差分プライバシークエリリリースに必要なプライベートサンプル数を著しく削減できるか?
- RQ2有限VC次元をもつクエリクラスにおいて、プライベートサンプルとパブリックサンプルの複雑度の最適なトレードオフは何か?
- RQ3プライベートサンプル複雑度における$\sqrt{p}$依存性は、必須であるか。ここで$p$はクエリクラスの双対VC次元である。
- RQ4PAPクエリリリースに必要な最小のパブリックサンプル複雑度は何か。また、これは$\alpha$に関してタイトか?
- RQ5パブリックデータの使用は、無限クエリクラスに対して標準的な差分プライバシークエリリリースが不可能であるという結果を克服できるか?
主な発見
- この論文は、VC次元$d$および双対VC次元$p$をもつ任意のクエリクラスに対して、$\tilde{O}(d/\alpha)$個のパブリックサンプルと$\tilde{O}(\sqrt{p}d^{3/2}/\alpha^2)$個のプライベートサンプルで十分であるという上界を確立している。
- 意思決定スティンプのクラスに対して、パブリックサンプルサイズが$1/\alpha^2$未満の場合、プライベートサンプル複雑度に$\Omega(\sqrt{p}/\alpha)$の下界が示され、$\sqrt{p}$依存性が必須であることが証明された。
- 広範なクエリクラスの族に対して、パブリックサンプル複雑度に$\Omega(1/\alpha)$の下界が確立され、上界と一致するため、$\alpha$に関してタイトであることが示された。
- 結果として、パブリックデータを用いることで、標準的なプライベートクエリリリースと比較して、プライベートサンプル複雑度をほぼ2乗の要因で削減可能であることが示された。
- リトルスタイン次元が無限である、例えば$\mathbb{R}$上のしきい値のクラスでは、パブリックサンプル複雑度は$\Omega(1/\alpha)$である必要があり、これはプライベートサンプルがゼロであっても同様である。
- このフレームワークは、標準的なDPクエリリリースが不可能なクラスに対しても、パブリックデータを用いてプライベートクエリリリースを可能にできることを示している。たとえVC次元が1であっても同様である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。