[论文解读] Differentially Private Learning of Undirected Graphical Models using Collective Graphical Models
本文提出了一种基于集体图模型(CGMs)的差分隐私学习方法,用于离散的无向图模型,通过从带有拉普拉斯噪声的隐私化数据中推断真实充分统计量。通过将CGM推理整合到EM框架中,该方法在噪声充分统计量上的模型质量显著优于朴素的最大似然估计,并在合成数据和真实人类移动数据上均优于通用的私有学习方法。
We investigate the problem of learning discrete, undirected graphical models in a differentially private way. We show that the approach of releasing noisy sufficient statistics using the Laplace mechanism achieves a good trade-off between privacy, utility, and practicality. A naive learning algorithm that uses the noisy sufficient statistics "as is" outperforms general-purpose differentially private learning algorithms. However, it has three limitations: it ignores knowledge about the data generating process, rests on uncertain theoretical foundations, and exhibits certain pathologies. We develop a more principled approach that applies the formalism of collective graphical models to perform inference over the true sufficient statistics within an expectation-maximization framework. We show that this learns better models than competing approaches on both synthetic data and on real human mobility data used as a case study.
研究动机与目标
- 为解决在差分隐私保护下学习准确的离散无向图模型的挑战,特别是当敏感数据必须受到保护时。
- 通过采用严谨的推理框架,克服朴素私有学习方法的局限性,如忽略数据结构、理论基础薄弱以及病态行为。
- 通过基于噪声观测推断真实充分统计量,而非将噪声统计量视为精确值,从而提升模型效用。
- 在合成数据和真实世界移动数据场景下,展示该方法在实用性和理论性方面均优于通用私有学习算法。
提出的方法
- 应用拉普拉斯机制发布带有噪声的充分统计量(列联表)以确保差分隐私,敏感度由模型中的边数界定。
- 采用期望最大化(EM)框架,其中E步通过集体图模型(CGMs)对真实充分统计量进行推理,利用噪声观测数据。
- 利用CGM推理技术,基于噪声的、已隐私化的观测数据,计算未观测到的真实充分统计量的后验分布。
- 通过使用真实充分统计量的后验均值进行最大似然估计来执行参数学习,从而在噪声数据上的朴素MLE基础上提升模型准确性。
- 通过将每个个体的贡献归一化(每条边为1/K,其中K为非空转移数)对真实世界数据进行预处理,以降低敏感度和噪声幅度。
- 使用保留对数似然和KL散度作为度量,将所提出的基于CGM的方法与朴素MLE在噪声统计量上以及通用私有学习(PSGD)方法进行比较。
实验结果
研究问题
- RQ1与在噪声充分统计量上使用朴素MLE相比,基于严谨推理框架的CGM方法是否能提升在差分隐私下学习无向图模型的质量?
- RQ2利用集体图模型对真实充分统计量进行后验推理,如何影响模型效用与隐私-效用权衡?
- RQ3在真实世界移动数据上,所提出的方法是否在模型准确性和计算效率方面优于通用私有学习算法(如PSGD)?
- RQ4所提出的方法在多大程度上缓解了朴素私有学习方法固有的病态行为和理论缺陷?
主要发现
- 基于CGM的方法在合成数据和真实人类移动数据上均显著优于朴素MLE,表现为与真实分布的KL散度更低。
- 在合成数据上,CGM在所有隐私水平(ε)和群体规模(N)下均持续优于朴素MLE和PSGD,即使在低ε下也观察到性能提升。
- 在真实WiFi移动数据上,CGM的保留对数似然高于朴素MLE和PSGD,且随着ε增大或N增加,性能进一步提升。
- 朴素MLE速度最快,但CGM比朴素MLE慢约4倍至15倍,比PSGD慢约8倍至46倍,表明效用与效率之间具有合理权衡。
- 该方法成功缓解了朴素MLE在有限样本下估计不一致等病态行为,通过合理考虑充分统计量中的噪声。
- 通过将每个个体的贡献归一化,将敏感度从原始的24倍边数降低至仅边数,从而在减少噪声的同时实现更强的隐私保证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。