Skip to main content
QUICK REVIEW

[论文解读] Differentially Private Variational Inference for Non-conjugate Models

Joonas Jälkö, Onur Dikmen|arXiv (Cornell University)|Oct 27, 2016
Privacy-Preserving Technologies in Data被引用 12
一句话总结

本文提出了差分隐私变分推断(DPVI),一种适用于非共轭模型的通用隐私贝叶斯推断方法。通过在双重随机变分推断中应用梯度裁剪和扰动,DPVI 在强隐私保证下实现了接近非私有推断的精度,优于基于采样的方法(如 DP-SGLD),尤其在强隐私环境下表现更优。

ABSTRACT

Many machine learning applications are based on data collected from people, such as their tastes and behaviour as well as biological traits and genetic data. Regardless of how important the application might be, one has to make sure individuals' identities or the privacy of the data are not compromised in the analysis. Differential privacy constitutes a powerful framework that prevents breaching of data subject privacy from the output of a computation. Differentially private versions of many important Bayesian inference methods have been proposed, but there is a lack of an efficient unified approach applicable to arbitrary models. In this contribution, we propose a differentially private variational inference method with a very wide applicability. It is built on top of doubly stochastic variational inference, a recent advance which provides a variational solution to a large class of models. We add differential privacy into doubly stochastic variational inference by clipping and perturbing the gradients. The algorithm is made more efficient through privacy amplification from subsampling. We demonstrate the method can reach an accuracy close to non-private level under reasonably strong privacy guarantees, clearly improving over previous sampling-based alternatives especially in the strong privacy regime.

研究动机与目标

  • 开发一种通用、高效且差分隐私的推断方法,适用于任意非共轭贝叶斯模型。
  • 克服现有隐私贝叶斯推断方法的局限性,这些方法受限于指数族模型或存在高隐私预算消耗问题。
  • 通过将差分隐私融入双重随机变分推断,实现在复杂模型中实用的隐私推断。
  • 证明 DPVI 即使在强隐私约束(低 ε)下,也能实现接近非私有变分推断的精度。

提出的方法

  • DPVI 通过在单个数据点梯度层面应用差分隐私(梯度裁剪与扰动),扩展了双重随机变分推断。
  • 该方法使用阈值 $ c_t $ 对梯度进行裁剪以控制敏感度,随后向裁剪后的梯度添加拉普拉斯或高斯噪声,以确保 ε-差分隐私。
  • 利用子采样实现隐私放大,以降低每次梯度更新的隐私预算,提升效率。
  • 变分后验通过完全分解的分布近似:$ q(\pi) $ 通过高斯分布的 softmax 变换得到,$ q(\mu) $ 为对角协方差高斯分布,$ q(τ) $ 为对数正态分布。
  • 使用随机梯度上升优化变分下界(ELBO),并在梯度中添加噪声以保证隐私。
  • 评估中使用蒙特卡洛积分近似预测似然,方法在贝叶斯逻辑斯蒂回归和高斯混合模型上进行了验证。

实验结果

研究问题

  • RQ1能否开发一种既通用又高效的差分隐私变分推断方法,适用于非共轭模型?
  • RQ2在强隐私约束下,DPVI 与基于采样的隐私推断方法(如 DP-SGLD)相比性能如何?
  • RQ3通过子采样实现的隐私放大在多大程度上能提升差分隐私变分推断的效率?
  • RQ4DPVI 中的梯度裁剪是否显著改变变分目标的优化轨迹或驻点?

主要发现

  • 即使在低隐私预算(如 ε = 1)下,DPVI 仍能实现接近非私有基线的预测似然,展现出优异的效用-隐私权衡。
  • 在高斯混合模型中,DPVI 学习到的后验预测分布在组件位置和形状上比 DP-SGLD 更接近真实分布,视觉上更优。
  • 当隐私要求较宽松(ε 较高)时,DP-SGLD 在预测似然上优于 DPVI;但在强隐私环境(ε 较低)下,DPVI 表现更优。
  • 使用子采样比例 $ q = 0.003 $ 显著降低了每次迭代的隐私预算,从而实现了更稳定高效的优化。
  • 梯度裁剪在训练过程中持续生效,因其作用于每个数据点的梯度,不会随收敛而减弱,因此始终影响优化动态。
  • 更简单的后验近似(如对角协方差高斯分布)在 DP 下更有效,因其参数范数更小,表明模型简化可提升隐私效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。