Skip to main content
QUICK REVIEW

[论文解读] AIM: An Adaptive and Iterative Mechanism for Differentially Private Synthetic Data

Ryan M. McKenna, Brett Mullins|arXiv (Cornell University)|Jan 29, 2022
Privacy-Preserving Technologies in Data被引用 8
一句话总结

AIM 是一种新颖的、基于工作负载自适应的机制,通过基于新颖质量评分的迭代贪婪边际查询选择,生成差分隐私合成数据。该质量评分平衡了相关性、改进潜力和隐私预算。与以往方法相比,AIM 显著降低了误差,并提供了查询误差的分析性、高概率置信区间,使用户能够在不增加额外隐私成本的情况下评估生成后的准确性。

ABSTRACT

We propose AIM, a new algorithm for differentially private synthetic data generation. AIM is a workload-adaptive algorithm within the paradigm of algorithms that first selects a set of queries, then privately measures those queries, and finally generates synthetic data from the noisy measurements. It uses a set of innovative features to iteratively select the most useful measurements, reflecting both their relevance to the workload and their value in approximating the input data. We also provide analytic expressions to bound per-query error with high probability which can be used to construct confidence intervals and inform users about the accuracy of generated data. We show empirically that AIM consistently outperforms a wide variety of existing mechanisms across a variety of experimental settings.

研究动机与目标

  • 为解决生成针对用户工作负载定制的高精度差分隐私合成数据这一长期挑战。
  • 克服现有工作负载感知机制的局限性,这些机制通常在性能上不如无工作负载感知的基线方法。
  • 为用户提供可操作的、依赖数据的误差估计,以评估合成查询结果的准确性,从而增强信任并支持明智决策。
  • 设计一种机制,通过迭代优化自适应选择查询,提升数据效用的同时尊重差分隐私预算。
  • 提供一种实用的、带有置信区间的合成数据生成方法,支持真实场景中的部署。

提出的方法

  • AIM 遵循选择-测量-生成范式,使用 Private-PGM 从带有噪声的测量值生成合成数据。
  • 采用迭代、贪婪的选择过程,基于一种新颖的、低敏感度的质量评分来选择下一个边际查询。
  • 质量评分综合考虑了工作负载相关性、预期改进、当前估计质量以及剩余隐私预算。
  • 采用自适应轮次选择和每轮动态预算分配,以优化效用。
  • 通过智能候选集初始化,并应用后处理以确保一致性和准确性。
  • 利用中间私有测量值,推导出查询误差的分析性、高概率单边置信区间,且无需额外隐私成本。

实验结果

研究问题

  • RQ1工作负载自适应机制是否能在查询准确性方面显著优于现有的工作负载无关和工作负载感知的合成数据生成方法?
  • RQ2一种依赖数据的、后处理机制是否能提供可靠、高概率的误差区间,用于合成查询结果,且不损害隐私?
  • RQ3工作负载相关性、预期改进和隐私预算分配的整合如何影响合成数据的效用?
  • RQ4与固定或非自适应选择方法相比,迭代贪婪查询选择策略在多大程度上降低了误差?
  • RQ5所提出的置信区间是否能帮助用户检测并理解真实部署中合成数据的不准确性?

主要发现

  • 在多样化实验设置和工作负载下,AIM 始终显著优于多种现有机制,包括 MWEM+PGM、RAP 和 GEM。
  • 所提出的质量评分实现了更有效的查询选择,使合成数据生成的误差低于以往的自适应方法。
  • AIM 提供了查询误差的分析性、高概率置信区间,这些区间真实反映了在输入数据上的实际执行情况,为用户提供可操作的精度估计。
  • 置信区间通过仅使用现有私有测量值在事后计算得出,不产生额外隐私成本。
  • 实证结果表明,AIM 即使在复杂工作负载(包括混合数据类型和非线性目标)下也实现了卓越的效用。
  • 该方法对数据离散化具有鲁棒性,且可扩展以整合公开数据,为提升效用开辟了新途径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。