[论文解读] Minimax Rates of Estimating Approximate Differential Privacy
本文提出了一种数据驱动的、极小化极大最优估计器,通过黑盒访问机制来近似 $(\varepsilon, \delta)$-差分隐私保证。通过利用多项式逼近来平衡偏差与方差,该方法实现了有效的样本量放大,相较于插补估计器在样本效率上提升了 $\ln n$ 因子,并通过匹配的下界证明了其极小化极大最优性。
Differential privacy has become a widely accepted notion of privacy, leading to the introduction and deployment of numerous privatization mechanisms. However, ensuring the privacy guarantee is an error-prone process, both in designing mechanisms and in implementing those mechanisms. Both types of errors will be greatly reduced, if we have a data-driven approach to verify privacy guarantees, from a black-box access to a mechanism. We pose it as a property estimation problem, and study the fundamental trade-offs involved in the accuracy in estimated privacy guarantees and the number of samples required. We introduce a novel estimator that uses polynomial approximation of a carefully chosen degree to optimally trade-off bias and variance. With $n$ samples, we show that this estimator achieves performance of a straightforward plug-in estimator with $n \ln n$ samples, a phenomenon referred to as effective sample size amplification. The minimax optimality of the proposed estimator is proved by comparing it to a matching fundamental lower bound.
研究动机与目标
- 为解决在实际应用中验证 $(\varepsilon, \delta)$-差分隐私保证的严峻挑战,特别是在机制存在设计或实现错误时。
- 开发一种数据驱动的、黑盒方法,用于估计隐私保证,而无需访问机制的内部逻辑。
- 刻画估计精度与样本复杂度之间在估计差分隐私参数时的根本权衡。
- 通过推导并匹配一个基本下界,建立所提估计器的极小化极大最优性。
提出的方法
- 该方法将隐私估计形式化为一个属性估计问题,使用近似 DP 散度 $d_\varepsilon(P\|Q) = \sum_{i=1}^S [p_i - e^\varepsilon q_i]^+$。
- 提出一种基于 $f$-散度函数 $f(x) = [1 - e^\varepsilon x]^+$ 的多项式逼近的新型估计器,通过精心选择多项式次数以平衡偏差与方差。
- 利用来自 $n$ 个黑盒样本的经验分布来近似真实散度,理论保证了偏差与方差。
- 一个关键技术组件是使用切比雪夫型多项式逼近来控制逼近误差,并推导集中性界。
- 通过构建与上界匹配的下界,证明了估计误差的极小化极大最优性。
- 分析利用了集中不等式以及对近似函数导数的 $L_2$-范数的界,以控制估计误差。
实验结果
研究问题
- RQ1从黑盒访问估计 $(\varepsilon, \delta)$-差分隐私保证所需的样本复杂度的根本极限是什么?
- RQ2非参数、数据驱动的估计器能否在隐私估计中实现比标准插补估计器更优的样本效率?
- RQ3在估计近似 DP 散度时,如何实现偏差与方差的最优权衡?
- RQ4是否存在一个极小化极大最优的隐私估计器,且能否通过多项式逼近构造?
- RQ5与插补方法相比,所提估计器的有效样本量放大增益是多少?
主要发现
- 所提估计器的样本复杂度等价于使用 $n \ln n$ 个样本的插补估计器,展示了 $\ln n$ 因子的有效样本量放大。
- 该估计器是极小化极大最优的,因其估计误差的上界与问题的根本下界相匹配。
- 该方法为现实世界机制提供了数据驱动的验证工具,能够检测设计或实现中的错误隐私声明。
- 分析表明,估计近似 DP 散度的误差被限制在 $O\left(\sqrt{\frac{c_1 \ln n}{n}}\right)$ 之内,常数取决于机制输出分布。
- 该方法对高维输出空间具有鲁棒性,并可扩展至更一般的近似 DP 设置,而不仅限于纯差分隐私。
- 该方法揭示了隐私估计与多项式逼近之间的根本联系,为隐私场景下的非参数散度估计提供了一个新框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。