[论文解读] Near Instance-Optimality in Differential Privacy
本文通过定义局部极小极大风险和无偏机制界,提出了微差隐私中的实例最优性,表明估计量的局部模连续性完全决定了最优误差。该文提出了反向敏感度机制,该机制可自适应于数据实例,并在连续函数及中位数、回归等鲁棒估计量上,统一优于平滑敏感度和拉普拉斯机制。
We develop two notions of instance optimality in differential privacy, inspired by classical statistical theory: one by defining a local minimax risk and the other by considering unbiased mechanisms and analogizing the Cramer-Rao bound, and we show that the local modulus of continuity of the estimand of interest completely determines these quantities. We also develop a complementary collection mechanisms, which we term the inverse sensitivity mechanisms, which are instance optimal (or nearly instance optimal) for a large class of estimands. Moreover, these mechanisms uniformly outperform the smooth sensitivity framework on each instance for several function classes of interest, including real-valued continuous functions. We carefully present two instantiations of the mechanisms for median and robust regression estimation with corresponding experiments.
研究动机与目标
- 开发微差隐私中与实例相关的最优性概念,以反映数据依赖的困难程度,而非最坏情况的界。
- 利用局部极小极大风险和无偏估计建立私有机制的下界,类似于经典Cramér-Rao界。
- 设计一类新机制——反向敏感度机制,使其可自适应于数据实例并实现近似实例最优性。
- 证明这些机制在各类函数类上统一优于现有框架(如平滑敏感度和拉普拉斯机制)。
- 将该框架扩展至连续估计量(如中位数和鲁棒回归),并提供理论与实证验证。
提出的方法
- 通过私有局部极小极大框架定义实例相关的下界,其中函数在数据集处的局部模连续性决定了误差下限。
- 提出反向敏感度机制,作为使用局部敏感度倒数的私有指数机制:$\mathbb{P}(M(\mathbf{x})=t) \propto \exp(-\mathsf{len}_f(\mathbf{x};t)\varepsilon/2)$。
- 对于连续估计量,通过定义$\mathsf{len}_f(\mathbf{x};t)$为使$f(\mathbf{x}')=t$的最小汉明距离,构建反向敏感度的连续类比。
- 利用变量变换和旋转对称性,从$\pi(t) \propto \exp(-\|A t\|)$中采样,实现在高维空间中的高效采样。
- 应用泰勒展开和误差界比较目标密度$\pi$与二次近似$q$,表明二者之比远离零。
- 在中位数和鲁棒回归上对机制进行实证验证,结果表明其精度优于拉普拉斯和平滑敏感度机制。
实验结果
研究问题
- RQ1是否可以定义微差隐私中的实例相关下界,使其反映在特定数据集上私有估计的真实困难程度?
- RQ2私有机制在多大程度上可自适应于数据集的局部结构,而非依赖于最坏情况的全局敏感度?
- RQ3是否存在一类机制,可在包括连续和鲁棒估计量在内的各类函数类上实现近似实例最优性?
- RQ4反向敏感度机制在误差和自适应性方面与平滑敏感度和拉普拉斯机制相比如何?
- RQ5反向敏感度机制的理论最优性是否可扩展至连续输出空间,并提供可证明的性能保证?
主要发现
- 估计量的局部模连续性完全决定了实例相关的极小极大风险和无偏估计下界。
- 在相同数据集上,反向敏感度机制比任何其他$\varepsilon$-差分隐私机制更可能返回真实值$f(\mathbf{x})$。
- 对于$\mathbb{R}$-值连续函数,反向敏感度机制在每个实例上均统一优于拉普拉斯和平滑敏感度机制。
- 在中位数估计中,反向敏感度机制的误差显著低于拉普拉斯和平滑敏感度机制,尤其在稀疏或偏态数据中表现更优。
- 在鲁棒回归中,该机制在数据污染下仍保持高精度,由于噪声尺度的自适应性,优于基线方法。
- 理论分析确认,目标密度$\pi$与其中二次近似$q$之比远离零,从而保证了近似最优性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。