[论文解读] Parametric Bootstrap for Differentially Private Confidence Intervals
本文提出参数自展法作为一种实用的、通用的构建差分隐私置信区间的策略,能够联合考虑抽样噪声和隐私噪声。该方法在小样本情况下仍能实现一致且校准良好的区间,覆盖性能优异,优于子样本聚合与渐近方法等替代方案。
The goal of this paper is to develop a practical and general-purpose approach to construct confidence intervals for differentially private parametric estimation. We find that the parametric bootstrap is a simple and effective solution. It cleanly reasons about variability of both the data sample and the randomized privacy mechanism and applies "out of the box" to a wide class of private estimation routines. It can also help correct bias caused by clipping data to limit sensitivity. We prove that the parametric bootstrap gives consistent confidence intervals in two broadly relevant settings, including a novel adaptation to linear regression that avoids accessing the covariate data multiple times. We demonstrate its effectiveness for a variety of estimators, and find that it provides confidence intervals with good coverage even at modest sample sizes and performs better than alternative approaches.
研究动机与目标
- 开发一种通用方法,用于在差分隐私统计估计中构建置信区间。
- 解决在隐私估计器中联合建模抽样噪声与隐私噪声的挑战。
- 校正为限制敏感性而对数据进行裁剪所引入的偏差。
- 提供一种避免重复数据访问的方法,从而最小化隐私成本。
- 在多种隐私估计场景中实现一致且校准良好的置信区间。
提出的方法
- 参数自展通过从拟合的参数模型中重采样数据,以近似私有估计量的抽样分布。
- 利用后处理技术避免多次数据访问,从而几乎不增加额外的隐私成本。
- 使用Efron的百分位数法基于自展重抽样结果构建置信区间。
- 通过估计并调整因数据裁剪导致的抽样分布偏移,实现偏差校正。
- 对于线性回归,提出一种新颖的混合自展方法,避免对协变量数据的重复访问。
- 理论上证明了在指数族分布与充分统计量扰动(SSP)下的线性回归中,该方法具有一致性。
实验结果
研究问题
- RQ1参数自展能否在差分隐私估计中生成一致且校准良好的置信区间?
- RQ2与渐近方法及子样本与聚合方法相比,参数自展在覆盖概率与区间宽度方面表现如何?
- RQ3参数自展能否有效校正隐私估计中因数据裁剪产生的偏差?
- RQ4在隐私噪声不可忽略的小样本情况下,该方法是否仍能保持良好性能?
- RQ5参数自展能否在不重复访问数据的前提下适配于差分隐私线性回归?
主要发现
- 即使在小样本量(n=10)下,参数自展仍能实现接近名义覆盖水平(如95%),而私有Fisher置信区间则表现出显著的覆盖不足。
- 与子样本与聚合方法相比,自展区间更紧凑且校准更优;后者因方差过高且校准差而表现不佳。
- 在指数族分布中,参数自展正确地考虑了隐私噪声,导致区间更宽,准确反映了不确定性增加。
- 在线性回归中,所提出的混合自展方法避免了重复数据访问,同时以极低的隐私成本维持了良好的覆盖性能。
- 通过参数自展实现的偏差校正,能有效缓解泊松分布与正态分布中因右尾数据裁剪导致的估计偏差。
- 由于隐私噪声在小样本下不可忽略,渐近方法无法提供足够的覆盖,而自展方法则保持了鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。