Skip to main content
QUICK REVIEW

[论文解读] That which we call private

Úlfar Erlingsson, Ilya Mironov|arXiv (Cornell University)|Aug 8, 2019
Privacy-Preserving Technologies in Data参考文献 17被引用 15
一句话总结

本文阐明,诸如 zCDP 和 RDP 等改进的差分隐私定义并未减少实际的隐私损失,而是对最坏情况下的隐私损失提供了显著更紧的上界估计,通常可将 epsilon 估计值降低一个数量级以上。作者证明,这些改进定义下观察到的实证攻击成功率上升,实际上是由于简单分析中使用了更松散的上界所致,而非隐私保护能力变弱。本文提出利用基于攻击的下界估计,以缩小‘隐私区间’,从而实现对机器学习模型隐私更精确的评估。

ABSTRACT

The guarantees of security and privacy defenses are often strengthened by relaxing the assumptions made about attackers or the context in which defenses are deployed. Such relaxations can be a highly worthwhile topic of exploration---even though they typically entail assuming a weaker, less powerful adversary---because there may indeed be great variability in both attackers' powers and their context. However, no weakening or contextual discounting of attackers' power is assumed for what some have called "relaxed definitions" in the analysis of differential-privacy guarantees. Instead, the definitions so named are the basis of refinements and more advanced analyses of the worst-case implications of attackers---without any change assumed in attackers' powers. Because they more precisely bound the worst-case privacy loss, these improved analyses can greatly strengthen the differential-privacy upper-bound guarantees---sometimes lowering the differential-privacy epsilon by orders-of-magnitude. As such, to the casual eye, these analyses may appear to imply a reduced privacy loss. This is a false perception: the privacy loss of any concrete mechanism cannot change with the choice of a worst-case-loss upper-bound analysis technique. Practitioners must be careful not to equate real-world privacy with differential-privacy epsilon values, at least not without full consideration of the context.

研究动机与目标

  • 解决一个看似矛盾的现象:尽管 zCDP 和 RDP 等改进的差分隐私定义提供了更紧的理论边界,但其在某些研究中似乎表现出更高的隐私泄露风险。
  • 阐明模型的实际隐私损失是固定不变的,且与所采用的分析方法无关,仅上界估计值会发生变化。
  • 证明实证成员推断攻击可用于推导模型真实差分隐私参数的有意义下界。
  • 通过结合高级分析技术与实证攻击结果,缩小‘隐私区间’——即 epsilon 上下界之间的差距——以实现对模型真实隐私保障的更精确估计。
  • 提醒实践者避免将改进分析方法得出的更低 epsilon 值等同于实际隐私保护能力的增强,强调上下文信息与边界的紧致性。

提出的方法

  • 对在不同差分隐私定义(原始、高级、zCDP、RDP)下训练的模型进行再分析,固定目标 epsilon 值,以隔离分析方法对实际隐私损失的影响。
  • 将 Jayaraman 和 Evans(USENIX Security 2019)的实证攻击结果重新格式化:固定模型噪声(通过训练损失),并将结果重述为(epsilon 上界,攻击成功次数)对的形式。
  • 应用定理 3 推导基于模型在 5% FPR 下的成员推断攻击优势,获得其真实 epsilon 的下界。
  • 以更紧的 RDP 分析作为上界,以攻击推导的优势作为下界,为每个模型构建‘隐私区间’。
  • 在对数-对数坐标系上绘制隐私区间,以可视化随着分析与攻击技术的提升,不确定性范围如何逐步缩小。
  • 考虑成员推断攻击中的阈值选择问题,指出最优阈值可增强下界估计,尽管这会引入极少的辅助信息。

实验结果

研究问题

  • RQ1为何在某些研究中,尽管 zCDP 和 RDP 等改进的差分隐私定义提供了更紧的理论边界,却似乎表现出更高的实证隐私泄露?
  • RQ2在不改变实际隐私损失的前提下,不同的差分隐私分析技术(如原始方法 vs. RDP)对同一模型的上界 epsilon 估计值有多大影响?
  • RQ3实证成员推断攻击能否用于推导模型真实差分隐私参数的有意义下界?
  • RQ4结合高级分析(如 RDP)与实证攻击结果,如何缩小围绕模型真实隐私保障的不确定性区间?
  • RQ5训练数据与测试数据之间的分布差异,对成员推断攻击结果作为隐私指标的有效性有何影响?

主要发现

  • 在不同差分隐私定义(如原始 vs. RDP)下训练至相同目标 epsilon 的模型,其实际隐私损失和模型效用存在显著差异,尽管上界 epsilon 值保持固定。
  • 在 RDP 等改进定义下观察到的攻击成功率上升,并非源于隐私保护能力变弱,而是因为原始 DP 等简单定义的上界过于松散,导致其 epsilon 值过于悲观。
  • 对于噪声尺度为 136.67× 的模型,基于 RDP 的 epsilon 上界为 0.05,而基于攻击的下界为 0,表明真实 epsilon 落在区间 [0, 0.05] 内。
  • 当噪声尺度减小(如 0.44×)时,RDP 分析的上界上升至 44,770,而基于攻击的下界达到 3.5×10⁸,表明当分析与攻击的边界均较松时,隐私区间可能极为宽泛。
  • ‘隐私区间’——即最紧的可用上界(RDP)与攻击推导的下界之间的区间——随着分析技术的改进和攻击强度的增强而显著缩小,从而提供对真实隐私更精确的估计。
  • 即使仅引入极少的辅助信息(如最优阈值选择),攻击推导的下界依然具有实用价值,因为上下界本身均存在松散性,而通过收紧两者可整体提升隐私估计的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。