Skip to main content
QUICK REVIEW

[论文解读] Differentially Private Uniformly Most Powerful Tests for Binomial Data

Jordan Awan, Aleksandra Slavković|arXiv (Cornell University)|May 23, 2018
Privacy-Preserving Technologies in Data参考文献 20被引用 19
一句话总结

该论文通过引入截断均匀拉普拉斯(Tulap)分布作为最优噪声机制,推导出在 $(\epsilon,\delta)$-差分隐私约束下二项比例的统一最优势(UMP)假设检验。UMP检验仅依赖于样本和,可通过对Tulap分布随机变量进行后处理精确计算,从而获得精确的 $p$-值,并在有限样本下表现出优于现有方法的性能。

ABSTRACT

We derive uniformly most powerful (UMP) tests for simple and one-sided hypotheses for a population proportion within the framework of Differential Privacy (DP), optimizing finite sample performance. We show that in general, DP hypothesis tests for exchangeable data can always be expressed as a function of the empirical distribution. Using this structure, we prove a `Neyman-Pearson lemma' for binomial data under DP, where the DP-UMP only depends on the sample sum. Our tests can also be stated as a post-processing of a random variable, whose distribution we coin "Truncated-Uniform-Laplace" (Tulap), a generalization of the Staircase and discrete Laplace distributions. Furthermore, we obtain exact p-values, which are easily computed in terms of the Tulap random variable. We show that our results also apply to distribution-free hypothesis tests for continuous data. Our simulation results demonstrate that our tests have exact type I error, and are more powerful than current techniques.

研究动机与目标

  • 在 $(\epsilon,\delta)$-差分隐私的严格约束下,开发二项比例的统一最优势(UMP)假设检验。
  • 识别在保证隐私的同时保留统计效用的最优噪声机制,超越启发式噪声添加方法。
  • 为差分隐私假设检验提供精确的 $p$-值和有限样本保证,解决先前工作中依赖渐近近似的局限性。
  • 通过相同的理论框架,将DP检验的适用性扩展至连续数据的分布自由推断。
  • 通过证明在所有DP检验类中具有最优性,为差分隐私下的最优统计推断奠定基础。

提出的方法

  • 证明对于交换数据,任何差分隐私检验仅依赖于经验分布,从而将问题简化为二项数据的样本和。
  • 引入截断均匀拉普拉斯(Tulap)分布作为离散拉普拉斯和阶梯分布的推广,该分布是 $(\epsilon,\delta)$-DP下的最优噪声机制。
  • 将DP-UMP检验表示为Tulap分布随机变量的后处理函数,确保同时满足隐私性和最优性。
  • 通过定理7.2和算法2建立精确 $p$-值,计算Tulap分布的尾部概率。
  • 证明UMP检验结构可适用于连续数据的分布自由检验,通过利用相同的充分统计量和噪声机制。
  • 利用Tulap分布推导出经过差分隐私化处理的检验统计量的精确抽样分布,实现对第一类错误的精确控制。

实验结果

研究问题

  • RQ1能否在 $(\epsilon,\delta)$-差分隐私下为二项比例检验推导出统一最优势(UMP)检验?
  • RQ2何种最优噪声分布可在满足差分隐私约束的同时实现UMP检验?
  • RQ3能否为DP假设检验计算精确 $p$-值,避免依赖渐近近似?
  • RQ4UMP性质是否可扩展至连续数据的分布自由检验?
  • RQ5是否存在一种通用表征,将最优DP检验表示为充分统计量的函数,即使在隐私约束下也成立?

主要发现

  • DP-UMP检验仅依赖于样本和,即完备充分统计量,且在所有 $(\epsilon,\delta)$-DP检验中为最优。
  • 截断均匀拉普拉斯(Tulap)分布被证明满足 $(\epsilon,\delta)$-差分隐私,并作为UMP检验的最优噪声机制。
  • 通过Tulap分布随机变量的后处理计算精确 $p$-值,确保在名义显著性水平下第一类错误的精确控制。
  • 模拟结果表明,DP-UMP检验在小样本下比Vu和Slavkovic(2009)的正态近似方法具有更高的经验功效。
  • DP-UMP检验在所有 $\theta_0$ 值下均保持精确的第一类错误(接近 $\alpha = 0.05$),而正态近似方法则因 $\theta_0$ 的不同导致第一类错误被夸大或缩小。
  • 该框架可扩展至连续数据的分布自由检验(如符号检验和中位数检验),通过应用相同的隐私化充分统计量和Tulap噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。