Skip to main content
QUICK REVIEW

[论文解读] Differentially Private Query Release Through Adaptive Projection

Sergül Aydöre, William F. Brown|arXiv (Cornell University)|Mar 11, 2021
Privacy-Preserving Technologies in Data参考文献 36被引用 11
一句话总结

本文提出了一种用于在高隐私和高工作负载环境下释放大量统计查询答案的差分隐私算法,通过自适应的连续松弛投影机制实现。该方法通过支持可微优化和基于高误差查询的迭代优化,显著降低了最大误差,优于以往的方法。

ABSTRACT

We propose, implement, and evaluate a new algorithm for releasing answers to very large numbers of statistical queries like $k$-way marginals, subject to differential privacy. Our algorithm makes adaptive use of a continuous relaxation of the Projection Mechanism, which answers queries on the private dataset using simple perturbation, and then attempts to find the synthetic dataset that most closely matches the noisy answers. We use a continuous relaxation of the synthetic dataset domain which makes the projection loss differentiable, and allows us to use efficient ML optimization techniques and tooling. Rather than answering all queries up front, we make judicious use of our privacy budget by iteratively and adaptively finding queries for which our (relaxed) synthetic data has high error, and then repeating the projection. We perform extensive experimental evaluations across a range of parameters and datasets, and find that our method outperforms existing algorithms in many cases, especially when the privacy budget is small or the query class is large.

研究动机与目标

  • 解决在差分隐私约束下准确释放大量统计查询答案的挑战。
  • 克服在合成数据生成中离散投影计算不可行的问题,同时保持隐私保证。
  • 在现有方法失效的高隐私和高工作负载环境中提升准确性。
  • 利用深度学习工具链实现高效且可扩展的跨多种查询类别的部署。
  • 证明自适应、迭代的查询选择结合连续松弛,相比非自适应或离散方法能提供更高的实用性。

提出的方法

  • 通过将合成数据集的定义域进行连续松弛,使投影损失可微,从而支持一阶优化技术。
  • 采用迭代式自适应查询选择:每轮后,算法识别出误差较高的查询并仅回答这些查询,以节省隐私预算。
  • 通过基于梯度的优化,实现可微分的投影步骤,最小化噪声查询答案与合成数据集答案之间的L2距离。
  • 应用随机化取整,将松弛后的连续合成数据集转换为原始模式下的有效离散数据集。
  • 利用深度学习框架提供的自动微分和GPU加速能力,高效扩展至大规模查询集。
  • 该方法具有可扩展性:支持新查询类仅需实现查询评估函数,无需重新设计优化管道。

实验结果

研究问题

  • RQ1对投影机制进行连续松弛是否能在不牺牲隐私的前提下提升差分隐私查询释放的准确性?
  • RQ2与一次性回答所有查询相比,自适应、迭代的查询选择是否能更有效地利用隐私预算?
  • RQ3该方法在不同隐私预算和查询工作负载下,其准确性和运行时间的可扩展性如何?
  • RQ4从一组显式回答的查询中进行泛化,能在多大程度上提升对未见查询的性能?
  • RQ5该方法是否可轻松扩展至新查询类而无需架构变更?

主要发现

  • RAP在所有测试的隐私预算和查询数量下均显著优于FEM,尤其在高隐私(低ε)和高工作负载环境中。
  • 在Adult数据集的三重边际查询中,即使HDMM+LLS和HDMM+PGM具有硬编码优化,RAP在小工作负载环境下仍实现了比它们更低的最大误差。
  • 当ε = 0.1时,随着三重和五重边际查询数量增至64,RAP仍能保持较低的最大误差,且持续优于FEM。
  • 采用5倍过采样的随机化取整,与松弛后的合成数据集相比仅略微降低误差,表明数据保真度保持良好。
  • 最优的合成数据集大小n′约为1000–2000,超过此范围后误差因优化不稳定性而上升。
  • 运行时间随n′减小而降低,但当n′过小时性能下降,表明效率与准确性之间存在权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。