Skip to main content
QUICK REVIEW

[论文解读] TAPAS: a Toolbox for Adversarial Privacy Auditing of Synthetic Data

Florimond Houssiau, J.B. Jordon|arXiv (Cornell University)|Nov 12, 2022
Privacy-Preserving Technologies in Data被引用 15
一句话总结

TAPAS 是一个用于合成数据对抗性隐私审计的综合性工具箱,支持在多种威胁模型下系统性评估隐私风险。它提出了一套统一的威胁建模框架,实现了多种攻击类型(如成员推断、属性推断和影子建模),并表明即使经过差分隐私保护的生成器仍可能泄露隐私,实证估计的有效隐私预算(εeff)与理论保证之间存在显著差距。

ABSTRACT

Personal data collected at scale promises to improve decision-making and accelerate innovation. However, sharing and using such data raises serious privacy concerns. A promising solution is to produce synthetic data, artificial records to share instead of real data. Since synthetic records are not linked to real persons, this intuitively prevents classical re-identification attacks. However, this is insufficient to protect privacy. We here present TAPAS, a toolbox of attacks to evaluate synthetic data privacy under a wide range of scenarios. These attacks include generalizations of prior works and novel attacks. We also introduce a general framework for reasoning about privacy threats to synthetic data and showcase TAPAS on several examples.

研究动机与目标

  • 为解决合成数据生成器在实际中缺乏经验性隐私评估这一关键问题,这些生成器常被假设为具备隐私保护能力,但可能仍会泄露敏感信息。
  • 开发一个统一且可扩展的框架,用于建模隐私威胁场景中攻击者知识和目标的多样性。
  • 实现一套实用且可复现的隐私攻击库,以在现实条件下测试合成数据生成器。
  • 通过实证方法估计有效隐私预算(εeff),并与理论上的差分隐私保证进行比较。
  • 揭示当前合成数据评估实践的局限性,并推动上下文感知的隐私审计。

提出的方法

  • 提出一种通用的威胁建模框架,形式化定义攻击者的背景知识(例如,对数据集的访问、对生成器黑箱接口的访问)和攻击目标(例如,成员推断、属性推断)。
  • 引入一个模块化软件工具箱,实现多种攻击类型:局部邻域攻击、基于合成数据的推理攻击、Groundhog 攻击,以及具备随机查询功能的影子建模。
  • 采用两阶段评估流程:首先在子集上评估攻击性能以选择最优超参数;其次使用 Jagielski 等人 [14] 的方法对剩余数据进行 εeff 的统计估计。
  • 采用多种指标(包括准确率、AUC 和隐私增益)评估不同生成器和威胁模型下的攻击性能。
  • 将该工具箱应用于真实世界数据(2011 年英国人口普查微观数据)和三种生成器:PrivBayes(ε-DP)、MST(ε,δ-DP)和 CT-GAN(非私有)。
  • 使用统计置信区间估计 εeff,并与理论 ε 值进行比较,识别出隐私保证中的偏差。

实验结果

研究问题

  • RQ1在仅拥有合成数据和对生成器有限了解的前提下,攻击者在多大程度上能推断真实记录的成员身份或属性?
  • RQ2不同攻击策略(如影子建模、Groundhog 攻击、局部邻域攻击)在针对各类合成数据生成器时,其隐私泄露能力如何比较?
  • RQ3理论上的差分隐私保证(ε, δ)在实践中与实证估计的有效隐私预算(εeff)在多大程度上一致?
  • RQ4该工具箱能否检测出形式上具备差分隐私保护的生成器(如 ε=10 的 MST)中的隐私泄露?
  • RQ5导致理论隐私预算与实证估计的 εeff 之间存在差异的主要因素是什么?

主要发现

  • 具备随机查询功能的影子建模攻击优于其他攻击,其成员推断的 AUC 达到 0.70,而 Groundhog 攻击的 AUC 为 0.63。
  • 对于 ε=10 的 MST 生成器,实证估计的有效隐私预算(εeff)为 [0.86, 1.39],表明其与理论 ε 值之间存在显著差距。
  • 理论隐私预算 ε=10 并未落在估计 εeff 的 95% 置信区间内,表明形式化隐私分析或攻击最优性可能存在松散之处。
  • 即使在强攻击者假设下,具备差分隐私保护的生成器(如 PrivBayes 和 MST)仍表现出可测量的隐私泄露,凸显了仅依赖形式化保证的局限性。
  • 该工具箱成功识别出 CT-GAN 生成器(缺乏正式隐私保证)对所有测试攻击均表现出脆弱性,证实其缺乏隐私保护能力。
  • 结果强调了在真实世界威胁场景中,必须通过经验性、对抗性评估来检验合成数据的隐私保护能力,因为形式化保证并不能确保实际隐私安全。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。