Skip to main content
QUICK REVIEW

[论文解读] Data-Dependent Differentially Private Parameter Learning for Directed Graphical Models

Amrita Roy Chowdhury, Theodoros Rekatsinas|arXiv (Cornell University)|May 30, 2019
Privacy-Preserving Technologies in Data参考文献 59被引用 4
一句话总结

本文提出一种用于学习贝叶斯网络参数的、数据相关的差分隐私算法,基于数据和图结构优化条件概率分布之间的隐私预算分配。通过针对节点特异性敏感度和影响度定制噪声添加,该方法将所需隐私预算减少约3倍——在ε=1.0时实现与数据无关基线在ε=3.0时相当的推理效用。

ABSTRACT

Directed graphical models (DGMs) are a class of probabilistic models that are widely used for predictive analysis in sensitive domains, such as medical diagnostics. In this paper we present an algorithm for differentially private learning of the parameters of a DGM with a publicly known graph structure over fully observed data. Our solution optimizes for the utility of inference queries over the DGM and extit{adds noise that is customized to the properties of the private input dataset and the graph structure of the DGM}. To the best of our knowledge, this is the first explicit data-dependent privacy budget allocation algorithm for DGMs. We compare our algorithm with a standard data-independent approach over a diverse suite of DGM benchmarks and demonstrate that our solution requires a privacy budget that is $3 imes$ smaller to obtain the same or higher utility.

研究动机与目标

  • 解决数据无关差分隐私(DP)在贝叶斯网络参数学习中效用不足的问题,其中噪声未根据数据或图结构进行定制。
  • 通过基于数据依赖属性和图拓扑的显式隐私预算分配,最小化贝叶斯网络中推理查询的误差。
  • 为贝叶斯网络中条件概率分布(CPD)的隐私预算分配开发一种新颖的数据依赖型优化框架,提升效用-效率。
  • 提供推理查询误差的理论边界,将误差与树宽和最大节点度关联。
  • 通过降低等效效用下的隐私成本,使差分隐私在医疗等敏感领域中更具实用性。

提出的方法

  • 将贝叶斯网络参数学习分解为每个条件概率分布(CPD)的独立DP子问题,实现按节点分配隐私预算。
  • 采用两阶段方法:首先以速率β采样数据子集,使用较小的隐私预算ε^I估计初步参数和误差敏感度。
  • 制定一种数据依赖型优化目标,根据节点高度(h_i)、出度(o_i)、估计参数误差(δ̃_i)和敏感度(Δ̃_i^N)加权节点影响。
  • 使用一种新公式计算每个CPD的敏感度,仅针对子节点的分布进行优化,提升准确性和隐私会计效率。
  • 通过加权目标函数优化节点间隐私预算分配:∑(W[i]·δ̃_i/ε_i) + W[n]·δ̃_n/(ε^B - ε^I - ∑ε_i),其中W[i] = (h_i+1)(o_i+1)(Δ̃_i^N + 1)。
  • 使用拉普拉斯机制,将数据特定噪声校准至优化后的ε_i值,以确保最终模型满足ε-BDP。

实验结果

研究问题

  • RQ1在贝叶斯网络中,基于数据的条件概率分布(CPD)之间进行隐私预算分配,能否降低实现特定推理效用所需的总体隐私预算?
  • RQ2节点的影响度(以高度、出度和参数敏感度衡量)如何影响其最优隐私预算分配?
  • RQ3DP贝叶斯网络中推理查询误差的理论边界是什么?它们与图结构(如树宽、最大度)有何关系?
  • RQ4两阶段采样与优化流程能否在保持效用的前提下降低初始参数估计的成本?
  • RQ5与数据无关的DP基线相比,所提方法在效用和隐私预算效率方面表现如何?

主要发现

  • 所提算法在ε=1.0时实现的推理效用与数据无关基线在ε=3.0时相当,甚至更高。
  • 该方法在所有四个测试的贝叶斯网络基准上,将所需隐私预算减少约3倍,同时保持或提升效用。
  • 理论分析表明,推理误差的上界随贝叶斯网络的树宽呈指数依赖,而下界则依赖于最大节点度。
  • CPD的敏感度仅基于子节点的分布进行计算,从而实现更精确和高效的噪声校准。
  • 优化目标成功识别出高影响力节点(如根节点),并为其分配更高预算,从而提升整体推理准确性。
  • 采用采样(β)的两阶段方法降低了初始估计的隐私成本(ε^I),为最终参数计算释放了更多预算。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。