Skip to main content
QUICK REVIEW

[论文解读] Data-dependent PAC-Bayes priors via differential privacy

Gintare Karolina Dziugaite, Daniel M. Roy|arXiv (Cornell University)|Feb 26, 2018
Privacy-Preserving Technologies in Data参考文献 35被引用 9
一句话总结

本文提出一种利用微差隐私构建数据相关PAC-Bayes先验的方法,通过确保先验对数据扰动具有稳定性,从而实现更紧致的泛化界。研究表明,ϵ-微差隐私的先验均值可产生有效的PAC-Bayes泛化界,并在实验中表明,即使在传统界失效的情况下,该界仍保持非平凡,尤其在高温Gibbs后验下表现显著。

ABSTRACT

The Probably Approximately Correct (PAC) Bayes framework (McAllester, 1999) can incorporate knowledge about the learning algorithm and (data) distribution through the use of distribution-dependent priors, yielding tighter generalization bounds on data-dependent posteriors. Using this flexibility, however, is difficult, especially when the data distribution is presumed to be unknown. We show how an ε-differentially private data-dependent prior yields a valid PAC-Bayes bound, and then show how non-private mechanisms for choosing priors can also yield generalization bounds. As an application of this result, we show that a Gaussian prior mean chosen via stochastic gradient Langevin dynamics (SGLD; Welling and Teh, 2011) leads to a valid PAC-Bayes bound given control of the 2-Wasserstein distance to an ε-differentially private stationary distribution. We study our data-dependent bounds empirically, and show that they can be nonvacuous even when other distribution-dependent bounds are vacuous.

研究动机与目标

  • 为解决标准PAC-Bayes界在使用数据相关后验时因固定先验与后验间KL散度过大而变得平凡的局限性。
  • 通过利用微差隐私作为稳定性机制,使在数据分布未知的情况下也能在PAC-Bayes理论中使用数据相关先验。
  • 开发一种实用框架,利用SGLD等随机优化方法构建具有隐私保障的有效且非平凡的泛化界。
  • 通过实证验证,表明在其他数据相关界变得平凡时,私有PAC-Bayes界仍具有信息量,尤其在高温后验下表现突出。

提出的方法

  • 提出一个理论框架,其中ϵ-微差隐私的先验均值可通过控制对数据变化的敏感性,确保有效的PAC-Bayes泛化界。
  • 利用自适应数据分析与微差隐私的成果,推导出即使在数据相关先验选择下,仍以高概率成立的界。
  • 应用随机梯度Langevin动力学(SGLD)学习数据相关先验,并在特定条件下理论证明SGLD可实现(ϵ,δ)-微差隐私。
  • 制定两阶段优化过程:第一阶段,通过小τ₁的SGLD学习一个私有先验;第二阶段,使用高τ₂训练后验,从而在泛化误差上获得更紧致的界。
  • 通过从微差隐私先验中进行蒙特卡洛采样,近似PAC-Bayes界中的KL散度项,尤其适用于高维模型。
  • 在MNIST和合成数据集上,将所提的私有PAC-Bayes界与Lever界(一种标准数据相关界)进行比较,以评估其紧致性与非平凡性。

实验结果

研究问题

  • RQ1在先验依赖于数据的情况下,是否仍可使用数据相关先验而不违反i.i.d.假设?
  • RQ2微差隐私是否足以确保数据相关先验仍能产生有效的泛化界?
  • RQ3SGLD能否用于构建既满足微差隐私又可有效生成紧致泛化界的、数据相关的先验?
  • RQ4私有PAC-Bayes界与现有数据相关界(如Lever的界)相比表现如何,特别是在高温区域?
  • RQ5在其他界变得平凡时,私有PAC-Bayes界在何种条件下仍保持非平凡?

主要发现

  • 即使在τ值较高时Lever界变得平凡,私有PAC-Bayes界在真实标签设置下仍保持非平凡,尤其在高温区域表现突出。
  • 在MNIST数据集的真实标签设置下,当τ₂ ≥ 3×10⁴时,私有PAC-Bayes界比Lever界更紧致,测试误差降至0.06,而界始终低于0.65。
  • 在随机标签设置下,泛化误差在高τ时急剧上升,Lever界捕捉到了这一相变现象,而私有PAC-Bayes界仍保持信息量丰富。
  • 两阶段SGLD方法可在不导致界平凡的情况下支持更高的τ₂值,从而在保持理论有效性的前提下提升后验性能。
  • 私有界中的KL散度项对数据分布敏感,在贝叶斯风险较低的数据集中,其值显著低于Lever结果中的上界。
  • 通过从DP先验中采样10⁵个样本对对数配分函数(ln Z)进行蒙特卡洛近似,实现了高维设置下KL项的实用估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。