[论文解读] Locally Private Bayesian Inference for Count Models
本文提出了一种新颖的MCMC算法,用于在局部差分隐私约束下对泊松因子分解模型进行隐私保护的贝叶斯推断,该方法通过重新诠释几何机制(geometric mechanism)的斯凯拉姆分布(Skellam distribution)以及建立斯凯拉姆分布与贝塞尔分布(Bessel distribution)之间联系的定理,实现了高效后验抽样。该方法在真实Enron邮件数据上的主题建模和链接预测任务中,性能优于朴素方法,甚至优于非私有推断,展现出对噪声的鲁棒性以及在潜在结构恢复中更高的连贯性。
We present a general method for privacy-preserving Bayesian inference in Poisson factorization, a broad class of models that includes some of the most widely used models in the social sciences. Our method satisfies limited precision local privacy, a generalization of local differential privacy, which we introduce to formulate privacy guarantees appropriate for sparse count data. We develop an MCMC algorithm that approximates the locally private posterior over model parameters given data that has been locally privatized by the geometric mechanism (Ghosh et al., 2012). Our solution is based on two insights: 1) a novel reinterpretation of the geometric mechanism in terms of the Skellam distribution (Skellam, 1946) and 2) a general theorem that relates the Skellam to the Bessel distribution (Yuan & Kalbfleisch, 2000). We demonstrate our method in two case studies on real-world email data in which we show that our method consistently outperforms the commonly-used naive approach, obtaining higher quality topics in text and more accurate link prediction in networks. On some tasks, our privacy-preserving method even outperforms non-private inference which conditions on the true data.
研究动机与目标
- 开发一种适用于计数数据模型(特别是泊松因子分解模型)的隐私保护贝叶斯推断方法,且在局部隐私约束下运行。
- 解决在仅能访问通过局部差分隐私(local differential privacy)加噪的私有化数据时,拟合模型的统计挑战。
- 改进朴素方法(即把私有化数据当作未加噪数据处理)所导致的过拟合及潜在结构恢复不佳的问题。
- 提出有限精度局部隐私(LPLP),一种专为稀疏计数数据设计的隐私定义,是对标准局部差分隐私的推广。
- 证明隐私机制可作为正则化手段,提升模型在真实世界数据上的鲁棒性和性能。
提出的方法
- 提出有限精度局部隐私(LPLP),作为对局部差分隐私的推广,专为泊松因子分解模型中的稀疏计数数据设计。
- 应用几何机制(Ghosh et al., 2012)对计数数据进行私有化处理,并证明其满足LPLP。
- 通过斯凯拉姆分布重新诠释几何机制,实现对噪声过程的解析反演。
- 建立一个关于斯凯拉姆分布与贝塞尔分布之间关系的一般性定理,使后验抽样变得可计算。
- 开发一种新颖的MCMC算法,通过在给定模型参数下迭代地从其逆分布中重新抽样真实数据,反之亦然,实现在局部隐私约束下的后验近似。
- 设计该算法时采用模块化结构,使得可通过条件化于抽样得到的真实数据,复用现有的非私有MCMC采样器来处理潜在变量。
实验结果
研究问题
- RQ1能否开发一种贝叶斯推断方法,在数据经局部私有化后,仍能准确恢复泊松因子分解模型中的潜在结构?
- RQ2当通过斯凯拉姆分布重新诠释几何机制时,是否能实现对私有化过程的高效且精确的反演?
- RQ3所提出的方法是否能在模型连贯性和预测准确性方面优于将私有化数据视为未加噪数据的朴素方法?
- RQ4当正确建模时,局部隐私是否可作为一种正则化形式,从而在性能上超越非私有推断?
- RQ5在不同隐私预算下,该方法在真实世界的稀疏计数数据(如电子邮件通信网络)上的表现如何?
主要发现
- 所提出的方法在重建真实底层数据方面始终优于朴素方法,在合成数据和真实Enron邮件数据上均实现了更低的平均绝对误差(MAE)。
- 在Enron语料库上,该方法的重建MAE低于朴素方法和非私有方法(后者可访问真实数据)。
- 在缺失链接预测任务中,该方法在大多数设置下均实现了最低的保留MAE,优于朴素和非私有基线方法。
- 在主题建模中,所提出方法推断出的主题比朴素方法更具连贯性,表明其语义质量更优。
- 在高噪声水平下,该方法仍能成功恢复合成数据中的真实块结构,而朴素方法则过度拟合于噪声,无法恢复稀疏模式。
- 令人惊讶的是,隐私保护方法在某些情况下甚至优于非私有推断,表明噪声机制起到了正则化作用,可防止在泊松因子分解中对虚假结构的过拟合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。