[论文解读] Differentially Private Bayesian Inference for Generalized Linear Models
该论文提出了一种噪声感知的差分隐私贝叶斯推断方法,用于广义线性模型(GLMs),如逻辑回归和泊松回归,通过低阶数据矩近似充分统计量,并仅在摘要统计量层面一次性注入噪声。该方法在强隐私保证下实现了准确的后验估计并量化了不确定性,相较于现有的DP-SGLD基线方法,在多个数据集和隐私预算下均表现出更高的后验保真度和稳定性。
Generalized linear models (GLMs) such as logistic regression are among the most widely used arms in data analyst's repertoire and often used on sensitive datasets. A large body of prior works that investigate GLMs under differential privacy (DP) constraints provide only private point estimates of the regression coefficients, and are not able to quantify parameter uncertainty. In this work, with logistic and Poisson regression as running examples, we introduce a generic noise-aware DP Bayesian inference method for a GLM at hand, given a noisy sum of summary statistics. Quantifying uncertainty allows us to determine which of the regression coefficients are statistically significantly different from zero. We provide a previously unknown tight privacy analysis and experimentally demonstrate that the posteriors obtained from our model, while adhering to strong privacy guarantees, are close to the non-private posteriors.
研究动机与目标
- 为广泛应用的广义线性模型(GLMs)实现差分隐私贝叶斯推断,这些模型通常在差分隐私下缺乏不确定性量化。
- 解决判别模型(如回归)中隐私推断的挑战,其中输入数据X本身也是敏感的,且不存在自然先验。
- 开发一种方法,量化隐私噪声对后验不确定性的影响,从而实现对系数显著性的统计推断。
- 将现有基于充分统计量的差分隐私贝叶斯方法从线性模型扩展到更广泛的GLM类别。
- 提供紧密的隐私分析,并通过在真实世界数据集上的实证评估展示方法的效用。
提出的方法
- 该方法使用有限阶矩作为近似充分统计量,对GLMs中输入与输出的联合分布进行近似。
- 基于中心极限定理引入正态近似,以建模受扰动的矩,从而实现高效的后验计算。
- 通过将受扰动摘要统计量的敏感性纳入先验分布,构建噪声感知先验。
- 该方法利用矩匹配将模型参数拟合到受噪声影响的摘要统计量,确保与受扰动数据的一致性。
- 对DP机制执行紧密的敏感性分析,通过组合定理利用高斯机制实现精确的隐私会计。
- 该方法以逻辑回归和泊松回归作为示例,具有扩展至其他指数族模型的潜力。
实验结果
研究问题
- RQ1能否在缺乏充分统计量的广义线性模型上有效应用差分隐私贝叶斯推断,同时量化由隐私噪声带来的不确定性?
- RQ2如何构建一种先验分布,以考虑差分隐私过程中注入的噪声,特别是在输入数据本身也受隐私保护的情况下?
- RQ3使用基于矩的充分统计量近似对GLM中后验精度和隐私-效用权衡有何影响?
- RQ4与现有DP贝叶斯推断基线(如DP-SGLD)相比,该方法在后验保真度和稳定性方面表现如何?
- RQ5在强隐私约束下(例如 ε ≤ 0.1)该方法是否仍能保持高效用,特别是对于系数幅度较小的模型?
主要发现
- 在adult和diabetes数据集上,即使在强隐私规制(ε ≤ 0.1)下,使用该方法获得的私有后验分布与非私有后验分布非常接近。
- DP-SGLD基线的后验分布极不稳定——其结果从有偏到过度自信或过度不自信不等,表明后验估计存在显著波动。
- 对于真实系数为 θ = [-0.9, -0.5, 0.3] 的合成数据,当 ε > 0.1 时,私有与非私有后验的实证累积分布函数几乎完全重合,表明后验恢复能力极强。
- Kolmogorov-Smirnov评分随ε减小呈非递增趋势,证实该方法在不同隐私预算下均保持了高精度。
- 当 ||θ||₂ ≥ 3 时,精度急剧下降,可能是因为为降低计算成本而采用的泰勒级数近似存在截断效应。
- 敏感性分析实现了紧密的隐私会计,且该方法仅对摘要统计量扰动承担一次隐私成本,而不同于DP-SGLD等迭代方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。