[论文解读] Differentially private significance tests for regression coefficients
该论文提出了一组差分隐私算法,用于评估从隐私保护数据(如合成数据或带噪声的查询输出)中计算出的回归系数的统计显著性与符号。通过使用经过校准的拉普拉斯噪声进行截断的、带噪声的t统计量,该方法使用户能够验证:若在原始机密数据上计算,这些系数是否具有统计显著性。在适当的参数设置下,该方法与真实p值和符号高度一致。
Many data producers seek to provide users access to confidential data without unduly compromising data subjects' privacy and confidentiality. One general strategy is to require users to do analyses without seeing the confidential data; for example, analysts only get access to synthetic data or query systems that provide disclosure-protected outputs of statistical models. With synthetic data or redacted outputs, the analyst never really knows how much to trust the resulting findings. In particular, if the user did the same analysis on the confidential data, would regression coefficients of interest be statistically significant or not? We present algorithms for assessing this question that satisfy differential privacy. We describe conditions under which the algorithms should give accurate answers about statistical significance. We illustrate the properties of the proposed methods using artificial and genuine data.
研究动机与目标
- 解决分析师仅能访问隐私保护数据(如合成数据或扰动查询输出)时,评估回归系数统计显著性的挑战。
- 提供一种方法,使用户能够验证:若在原始机密数据上计算,回归系数是否具有统计显著性。
- 确保验证过程本身满足差分隐私,保护数据主体的机密性。
- 提供一种系统性方法,用于选择算法参数(M, a),在准确性和隐私之间取得平衡。
- 将该方法扩展至一般原假设检验与截距项显著性检验。
提出的方法
- 该方法基于经过扰动的回归系数和标准误,使用截断的、差分隐私计算的t统计量来估计显著性。
- 通过向t统计量添加拉普拉斯噪声以满足ε-差分隐私,同时通过截断来限制敏感度。
- 通过在隐私机制下模拟t统计量的原假设分布,计算差分隐私p值和符号。
- 通过最小化显著性检验误差的上界,选择截断水平(a)和抽样次数(M)。
- 将该方法扩展至检验一般原假设(如βj = b)以及通过单样本t检验框架检验截距项显著性。
- 验证服务器负责提供差分隐私p值和符号,使用户能够信任结果,而无需暴露机密数据。
实验结果
研究问题
- RQ1我们能否设计一种差分隐私方法,以评估:若在原始机密数据上计算,回归系数是否具有统计显著性?
- RQ2如何确保私有检验结果(p值与符号)与机密数据上的结果高度一致?
- RQ3哪些参数选择(M, a)能在保护隐私的同时最小化显著性检验的误差?
- RQ4该方法能否扩展至检验一般原假设(如βj = b)和截距项显著性?
- RQ5在不同隐私预算下,该方法在真实和人工数据集上的实际表现如何?
主要发现
- 当(M=25, a=2)时,差分隐私p值与机密数据的真实p值高度一致,尤其在原假设被强烈拒绝的系数上表现更佳。
- 该方法在符号预测方面实现了高度一致,仅在p值较大的系数上出现少量偏差,而这些偏差影响较小。
- 对于ε=0.5,推荐参数设置为(M=100, a=1),该设置在符号预测上保持强一致性,且p值对应关系可接受。
- 当ε=1.5时,显著性检验误差的上界最小化至0.05,此时a=1或a=2均可实现,但a=2因对t统计量的失真更小而更优。
- 即使在严格的隐私预算下,该方法仍有效保持了检测真实显著性与符号的能力,CPS数据集的实证结果已证明这一点。
- 该方法可扩展至一般原假设检验与截距项检验,使隐私保护推断的应用范围更广。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。