[论文解读] The Price of Selection in Differential Privacy
该论文建立了差分隐私环境下top-$k$选择所需样本复杂度的紧下界,证明在误差小于抽样误差$\sqrt{\log d / n}$的高精度范围内,$n = \Omega(k\log d)$是必要的。结果表明,选择$k$个最优列所需的数据量远超单独估计其值所需的数据量,从而解决了差分隐私中选择代价的根本性差距。
In the differentially private top-$k$ selection problem, we are given a dataset $X \in \{\pm 1\}^{n imes d}$, in which each row belongs to an individual and each column corresponds to some binary attribute, and our goal is to find a set of $k \ll d$ columns whose means are approximately as large as possible. Differential privacy requires that our choice of these $k$ columns does not depend too much on any on individual's dataset. This problem can be solved using the well known exponential mechanism and composition properties of differential privacy. In the high-accuracy regime, where we require the error of the selection procedure to be to be smaller than the so-called sampling error $α\approx \sqrt{\ln(d)/n}$, this procedure succeeds given a dataset of size $n \gtrsim k \ln(d)$. We prove a matching lower bound, showing that a dataset of size $n \gtrsim k \ln(d)$ is necessary for private top-$k$ selection in this high-accuracy regime. Our lower bound is the first to show that selecting the $k$ largest columns requires more data than simply estimating the value of those $k$ columns, which can be done using a dataset of size just $n \gtrsim k$.
研究动机与目标
- 确定差分隐私top-$k$选择在误差低于抽样误差条件下的最小样本量。
- 弥合现有上界与已知下界在私有top-$k$选择问题上的差距。
- 证明即使仅需识别出前$k$个属性,选择过程也比估计过程需要更多数据。
- 确立标准机制(如指数机制)的$\sqrt{k}\log d / n$误差在渐近意义上是最优的。
- 利用追踪攻击作为工具,推导差分隐私中信息论下界。
提出的方法
- 构建一种追踪攻击,其中攻击者需根据私有top-$k$算法的输出判断目标个体是否存在于数据集中。
- 使用一种数据集分布,其中$k$列的均值为$\lambda$,其余列均匀随机,以建模top-$k$选择问题。
- 应用霍夫丁不等式于正相关的随机变量,以限制过多个体低于阈值的概率。
- 利用数据矩阵中的正相关性,推导出比独立性假设更紧的尾部界。
- 利用在某些条目为$-1$的条件下,其他条目的期望值上升的事实,以限制罕见事件的概率。
- 推导出界$\mathbb{P}[\bigwedge_{i\in R} E_i] \leq \rho^{|R|}$,表明$|R|$个个体全部与top-$k$向量内积较低的概率呈指数衰减。
实验结果
研究问题
- RQ1差分隐私算法实现top-$k$列选择且误差小于抽样误差$\alpha = \sqrt{\log d / n}$所需的最小样本量$n$是多少?
- RQ2为何私有top-$k$列选择比私有估计其值需要更多数据?
- RQ3能否利用追踪攻击推导差分隐私中选择问题的紧下界?
- RQ4指数机制的$\sqrt{k}\log d / n$误差对于top-$k$选择是否最优?
- RQ5误差界中的$\log d$因子是否为根本限制,或可被消除?
主要发现
- 除非$n = \Omega(k\log d)$,否则差分隐私top-$k$选择算法无法实现误差小于$\alpha = \Omega(\sqrt{\log d / n})$。
- 样本复杂度下界$n = \Omega(k\log d)$与指数机制实现的上界一致,证明了其紧致性。
- 私有top-$k$列选择需要$\Omega(k\log d)$个样本,而仅对$k$个值进行私有估计仅需$\Omega(k)$个样本。
- 在高精度范围内,误差中的$\log d$因子不可避免,表明选择存在根本性代价。
- 该下界通过追踪攻击推导得出,表明选择的隐私成本严格高于估计。
- 分析表明,数据矩阵中的正相关性可被利用以获得更紧的集中不等式,这对证明至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。