Skip to main content
QUICK REVIEW

[论文解读] Deep Learning with Label Differential Privacy

Badih Ghazi, Noah Golowich|arXiv (Cornell University)|Feb 11, 2021
Privacy-Preserving Technologies in Data参考文献 92被引用 6
一句话总结

本文提出 RRWithPrior,一种新颖的差分隐私算法,通过利用先验分布来优化随机响应,从而在标签保护学习中提升准确性。该方法应用于仅对标签进行差分隐私保护的深度学习,实现了当前最优性能,显著缩小了私有模型与非私有模型之间的准确率差距——例如,在 ε=8、δ=10⁻⁵ 条件下,CIFAR-10 上的准确率达到 73%,优于以往基线方法。

ABSTRACT

The Randomized Response (RR) algorithm is a classical technique to improve robustness in survey aggregation, and has been widely adopted in applications with differential privacy guarantees. We propose a novel algorithm, Randomized Response with Prior (RRWithPrior), which can provide more accurate results while maintaining the same level of privacy guaranteed by RR. We then apply RRWithPrior to learn neural networks with label differential privacy (LabelDP), and show that when only the label needs to be protected, the model performance can be significantly improved over the previous state-of-the-art private baselines. Moreover, we study different ways to obtain priors, which when used with RRWithPrior can additionally improve the model performance, further reducing the accuracy gap between private and non-private models. We complement the empirical results with theoretical analysis showing that LabelDP is provably easier than protecting both the inputs and labels.

研究动机与目标

  • 解决在仅保护标签时,差分隐私深度学习中持续存在的性能差距问题。
  • 通过引入先验知识来改进经典随机响应(RR)机制,以减少噪声并提高准确率。
  • 设计一种实用的多阶段训练算法(LP-MST),集成 RRWithPrior 实现端到端的标签私有深度学习。
  • 证明标签差分隐私在理论上比输入与标签联合保护更简单,从而在相同隐私预算下实现更好的模型性能。
  • 研究不同类型先验(如来自公开数据、预训练模型或历史训练结果)如何进一步提升标签私有学习中的模型准确率。

提出的方法

  • 提出 RRWithPrior,一种改进的 RR 机制,利用先验分布 𝒑 对标签字母表进行剪枝,从而提高返回真实标签的概率。
  • 推导出在 ε-差分隐私下最优隐私-准确率权衡的闭式表达式,证明当标签从先验中抽取时,RRWithPrior 能最大化正确输出的概率。
  • 提出线性规划公式,证明在所有 ε-DP 机制中,RRWithPrior 在标签恢复概率方面是最优的。
  • 设计一种多阶段训练算法(LP-MST),在标签扰动阶段应用 RRWithPrior,从而实现标签 DP 下深度神经网络的高效训练。
  • 利用来自公开数据、预训练模型或历史训练过程的先验知识,进一步降低标签扰动中的误差,提升模型泛化能力。
  • 理论分析表明,标签 DP 严格优于完整输入与标签 DP(即同时保护输入和标签),从而在相同隐私预算下实现更优性能。

实验结果

研究问题

  • RQ1当仅保护标签时,能否利用先验知识来提升差分隐私学习的准确率?
  • RQ2在标签 DP 条件下,RRWithPrior 与经典 RR 及现有私有深度学习基线相比,模型准确率表现如何?
  • RQ3哪些类型的先验(如来自公开数据、预训练模型)最有效地缩小私有学习中的准确率差距?
  • RQ4标签差分隐私在本质上是否比同时保护输入和标签更简单?这种差异是否带来可测量的性能提升?
  • RQ5能否构建一种实用且可扩展的训练流水线,将先验感知的扰动机制集成到具备强隐私保障的深度学习中?

主要发现

  • 通过利用先验分布剪枝标签空间,RRWithPrior 在相同隐私预算下实现了比经典 RR 更高的标签恢复概率,从而提升了准确率。
  • 采用 RRWithPrior 的 LP-MST 训练流水线在 ε=8、δ=10⁻⁵ 条件下于 CIFAR-10 上实现了 73% 的测试准确率,达到当前最优报告结果,且方法更具通用性与理论严谨性。
  • 通过利用先验知识,特别是高质量先验时,该方法显著缩小了私有模型与非私有模型之间的准确率差距——此前该差距超过 20 个百分点。
  • 理论分析证明,标签 DP 严格优于完整 DP(即保护输入与标签),为实验中观察到的性能提升提供了理论依据。
  • 来自预训练模型或公开数据的先验知识可进一步降低泛化误差,且随着先验质量的提升,性能增益也随之增加。
  • 基于 Rademacher 复杂度的泛化误差界表明,私有模型的泛化误差与假设类的复杂度以及先验感知扰动机制的性质成正比,为实验中的性能增益提供了理论支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。