Skip to main content
QUICK REVIEW

[论文解读] Privately Learning Markov Random Fields

Huanyu Zhang, Gautam Kamath|arXiv (Cornell University)|Feb 21, 2020
Privacy-Preserving Technologies in Data参考文献 67被引用 4
一句话总结

本文研究了马尔可夫随机场(MRFs)的私有学习,表明在微分隐私下,结构学习与参数学习的样本复杂度要求具有根本性差异。非私有MRF学习的规模随维度对数增长,而仅近似微分隐私能保持结构学习的这种效率;参数学习及纯微分隐私或集中微分隐私则需要多项式样本复杂度,揭示了在高维设置下由隐私带来的显著分离。

ABSTRACT

We consider the problem of learning Markov Random Fields (including the prototypical example, the Ising model) under the constraint of differential privacy. Our learning goals include both structure learning, where we try to estimate the underlying graph structure of the model, as well as the harder goal of parameter learning, in which we additionally estimate the parameter on each edge. We provide algorithms and lower bounds for both problems under a variety of privacy constraints -- namely pure, concentrated, and approximate differential privacy. While non-privately, both learning goals enjoy roughly the same complexity, we show that this is not the case under differential privacy. In particular, only structure learning under approximate differential privacy maintains the non-private logarithmic dependence on the dimensionality of the data, while a change in either the learning goal or the privacy notion would necessitate a polynomial dependence. As a result, we show that the privacy constraint imposes a strong separation between these two learning problems in the high-dimensional data regime.

研究动机与目标

  • 研究在微分隐私约束下学习马尔可夫随机场(MRFs)的样本复杂度。
  • 比较在微分隐私背景下结构学习与参数学习的难度。
  • 在纯微分隐私、集中微分隐私和近似微分隐私下,为两个学习目标建立紧致的样本复杂度下界。
  • 确定在高维设置下,私有MRF学习保持高效性的条件。
  • 证明微分隐私从根本上改变了结构学习与参数学习之间的复杂度格局,这与非私有情形不同。

提出的方法

  • 构建一组具有有界边权重和结构化稀疏性的MRF,以建模底层图模型空间。
  • 使用概率耦合论证和信息论打包界,推导微分隐私下的样本复杂度下界。
  • 应用最大耦合引理,以界定由不同MRF参数诱导的分布之间的总变差距离。
  • 对纯微分隐私采用[ASZ20a]中的概率打包论证,对零集中微分隐私(zCDP)采用[BS16]中的方法。
  • 通过分析来自不同MRF分布的耦合样本之间的期望汉明距离,推导样本复杂度下界。
  • 结合KL散度与卡方距离的结果,以界定隐私损失并推导样本复杂度权衡。

实验结果

研究问题

  • RQ1在近似微分隐私下,学习成对MRF结构所需的最小样本复杂度是多少?
  • RQ2在纯微分隐私下,MRF参数学习的样本复杂度与结构学习相比如何?
  • RQ3微分隐私是否在高维MRF中导致结构学习与参数学习之间复杂度的分离?
  • RQ4在集中或纯微分隐私下,是否能为MRF结构学习保持对数样本复杂度?
  • RQ5在不同隐私概念下,私有MRF学习的最紧致样本复杂度下界是什么?

主要发现

  • 在近似微分隐私下,成对MRF的结构学习仅需维度的对数样本复杂度,与非私有情形一致。
  • 在纯或集中微分隐私下进行参数学习时,样本复杂度随维度多项式增长,即使结构学习仍保持高效。
  • 本文为近似DP下的结构学习建立了下界 $ n = \Omega\left(\frac{\sqrt{p}}{\eta\varepsilon} + \frac{k^2 p}{\varepsilon}\right) $,其中 $ p $ 为变量数,$ \eta $ 为最小边权重,$ k $ 为字母表大小。
  • 对于零集中微分隐私,下界为 $ n = \Omega\left(\sqrt{\frac{k^2 p}{\rho}}\right) $,显示出对 $ p $ 的多项式依赖。
  • 结果表明,在微分隐私下,结构学习与参数学习之间存在显著分离:尽管在近似DP下结构学习仍高效,但所有隐私制度下参数学习的成本均显著更高。
  • 研究表明,微分隐私从根本上改变了MRF学习的复杂度格局,使得在严格隐私约束下,高维设置中的参数学习变得不可行。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。