[论文解读] Data-dependent PAC-Bayes priors via differential privacy
本文提出一种利用微差隐私构建数据相关PAC-Bayes先验的方法,通过确保先验对数据扰动具有稳定性,从而实现更紧致的泛化界。研究表明,ϵ-微差隐私的先验均值可产生有效的PAC-Bayes泛化界,并在实验中表明,即使在传统界失效的情况下,该界仍保持非平凡,尤其在高温Gibbs后验下表现显著。
The Probably Approximately Correct (PAC) Bayes framework (McAllester, 1999) can incorporate knowledge about the learning algorithm and (data) distribution through the use of distribution-dependent priors, yielding tighter generalization bounds on data-dependent posteriors. Using this flexibility, however, is difficult, especially when the data distribution is presumed to be unknown. We show how an ε-differentially private data-dependent prior yields a valid PAC-Bayes bound, and then show how non-private mechanisms for choosing priors can also yield generalization bounds. As an application of this result, we show that a Gaussian prior mean chosen via stochastic gradient Langevin dynamics (SGLD; Welling and Teh, 2011) leads to a valid PAC-Bayes bound given control of the 2-Wasserstein distance to an ε-differentially private stationary distribution. We study our data-dependent bounds empirically, and show that they can be nonvacuous even when other distribution-dependent bounds are vacuous.
研究动机与目标
- 为解决标准PAC-Bayes界在使用数据相关后验时因固定先验与后验间KL散度过大而变得平凡的局限性。
- 通过利用微差隐私作为稳定性机制,使在数据分布未知的情况下也能在PAC-Bayes理论中使用数据相关先验。
- 开发一种实用框架,利用SGLD等随机优化方法构建具有隐私保障的有效且非平凡的泛化界。
- 通过实证验证,表明在其他数据相关界变得平凡时,私有PAC-Bayes界仍具有信息量,尤其在高温后验下表现突出。
提出的方法
- 提出一个理论框架,其中ϵ-微差隐私的先验均值可通过控制对数据变化的敏感性,确保有效的PAC-Bayes泛化界。
- 利用自适应数据分析与微差隐私的成果,推导出即使在数据相关先验选择下,仍以高概率成立的界。
- 应用随机梯度Langevin动力学(SGLD)学习数据相关先验,并在特定条件下理论证明SGLD可实现(ϵ,δ)-微差隐私。
- 制定两阶段优化过程:第一阶段,通过小τ₁的SGLD学习一个私有先验;第二阶段,使用高τ₂训练后验,从而在泛化误差上获得更紧致的界。
- 通过从微差隐私先验中进行蒙特卡洛采样,近似PAC-Bayes界中的KL散度项,尤其适用于高维模型。
- 在MNIST和合成数据集上,将所提的私有PAC-Bayes界与Lever界(一种标准数据相关界)进行比较,以评估其紧致性与非平凡性。
实验结果
研究问题
- RQ1在先验依赖于数据的情况下,是否仍可使用数据相关先验而不违反i.i.d.假设?
- RQ2微差隐私是否足以确保数据相关先验仍能产生有效的泛化界?
- RQ3SGLD能否用于构建既满足微差隐私又可有效生成紧致泛化界的、数据相关的先验?
- RQ4私有PAC-Bayes界与现有数据相关界(如Lever的界)相比表现如何,特别是在高温区域?
- RQ5在其他界变得平凡时,私有PAC-Bayes界在何种条件下仍保持非平凡?
主要发现
- 即使在τ值较高时Lever界变得平凡,私有PAC-Bayes界在真实标签设置下仍保持非平凡,尤其在高温区域表现突出。
- 在MNIST数据集的真实标签设置下,当τ₂ ≥ 3×10⁴时,私有PAC-Bayes界比Lever界更紧致,测试误差降至0.06,而界始终低于0.65。
- 在随机标签设置下,泛化误差在高τ时急剧上升,Lever界捕捉到了这一相变现象,而私有PAC-Bayes界仍保持信息量丰富。
- 两阶段SGLD方法可在不导致界平凡的情况下支持更高的τ₂值,从而在保持理论有效性的前提下提升后验性能。
- 私有界中的KL散度项对数据分布敏感,在贝叶斯风险较低的数据集中,其值显著低于Lever结果中的上界。
- 通过从DP先验中采样10⁵个样本对对数配分函数(ln Z)进行蒙特卡洛近似,实现了高维设置下KL项的实用估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。